发布Claude Tag以支持Slack中的团队协作
Anthropic发布了Claude Tag的Beta版,这是一项协作功能,将Claude直接作为活跃团队成员集成到Slack中。用户可以在频道中通过@Claude触发任务执行,该智能体模型可以拆解项目、编写代码并利用连接的工具。该功能支持多人协作、上下文记忆和主动更新。目前,Anthropic自身产品团队65%的代码是由内部版本的Claude Tag生成的。系统管理员可以为独立的频道范围Claude身份管理数据和工具权限。
每天一次,过滤 AI 噪音
Anthropic发布了Claude Tag的Beta版,这是一项协作功能,将Claude直接作为活跃团队成员集成到Slack中。用户可以在频道中通过@Claude触发任务执行,该智能体模型可以拆解项目、编写代码并利用连接的工具。该功能支持多人协作、上下文记忆和主动更新。目前,Anthropic自身产品团队65%的代码是由内部版本的Claude Tag生成的。系统管理员可以为独立的频道范围Claude身份管理数据和工具权限。
OpenAI宣布其GPT-5 Pro模型协助免疫学家Derya Unutmaz解决了关于T细胞行为的一项三年谜题。通过分析复杂的免疫学数据集,这款高级大语言模型成功解码了研究人员此前未能发现的细胞模式。这一里程碑证明了前沿模型如何被用于加速科学发现,特别是在模拟细胞生物学以支持未来针对自身免疫性疾病和癌症治疗的医学研究方面。
软件开发者Armin Ronacher详细介绍了软件工程领域的一个转变,即开发者编写外部Harness循环来自动运行编码智能体。在分析Claude Code等自主工具时,Ronacher指出,大语言模型的无监督迭代往往会降低整体代码质量。这些模型倾向于产生过度防御性、复杂且局部的变通方案来掩盖潜在的架构问题,这与高质量的“人在回路”开发者工作流形成了对比。
Omio已与OpenAI合作,将生成式AI集成到其主要的预订系统中,以开发对话式旅行体验。该合作使用户能够规划复杂的旅行路线,比较多模式交通工具,并使用对话式界面进行预订。此次实施是Omio向AI原生公司转型的一部分,旨在简化内部软件工程工作流,并根据消费者的实时查询生成高度个性化的旅行建议。
风险投资公司Andreessen Horowitz宣布Josh Elman已以合伙人身份加入,旨在识别并支持早期消费者AI公司。凭借其在Facebook、LinkedIn、Twitter和Robinhood的产品工程与领导经验,Elman将协助创始人进行产品开发、增长循环建设及分析消费者行为模式。此举凸显了风投机构关注生成式AI界面,并看好新一代习惯于交互平台的数字原住民用户。
作为DayBreak计划的一部分,OpenAI推出了GPT-5.5-Cyber,这是一款专为防御性网络安全运营设计的专业推理模型。该模型专门用于漏洞分析、自动补丁、实时威胁狩猎和逆向工程。它利用高级推理协助安全专业人员,并实现防御程序的大规模自动化。这一里程碑反映了将领域专业化自主智能体部署到数字基础设施中,以抵御日益复杂的网络威胁的战略性转变。
研究人员发布了VibeThinker,这是一款30亿参数的语言模型,在复杂推理任务上表现优于Claude Opus 4.5等大型系统。该模型采用了一种结合监督微调(SFT)和组相对策略优化(GRPO)的新型训练方法,以优化内部搜索路径和推理轨迹。这一强化学习突破证明了紧凑的参数配置也能实现顶级的逻辑和科学推理能力,为本地化边缘部署提供了高效的替代方案。
本文探讨了“即将来临的循环”,即人工智能系统在无需人工干预的情况下自主设计、训练并优化后续AI代际的转换过程。文章详述了从“人在回路”工程向完全自主、递归自我改进周期的转变。这种自我强化的循环呈指数级加速了AI能力的演进,同时也引入了复杂的对齐和控制挑战。文章认为,管理这一反馈循环是当前AI安全与计算机科学领域面临的最严峻挑战。
Anthropic更新了其服务条款和隐私政策,引入了新的年龄和身份验证要求。验证机制旨在确保监管合规并加强用户安全,特别是针对未成年人使用先进人工智能模型的限制。这一变化凸显了整个行业在商用大语言模型领域向更严格的治理和合规框架发展的趋势,旨在平衡广泛的平台接入与负责任的开发及风险缓解。
Anthropic推出了Claude Tag,这是一项新的生产力功能,旨在让用户对对话线程进行分类和组织。此更新旨在通过启用自定义标签来分组、检索和管理过去的AI交互,从而提高生成式AI平台的生产力和工作流效率。这反映了行业将简单的对话助手扩展为支持复杂、多会话任务的结构化生产力套件的更广泛趋势。
Google正式推出了Gemini Spark,这是一款旨在实现复杂、多步骤数字工作流自动化的新型个人AI智能体。作为24/7数字助理持续运行,该系统在用户的直接指导下从头到尾执行专业和个人任务。该产品的推出突显了Google向自主智能体行为的战略转型,即超越对话式聊天界面,在各种数字环境中执行集成动作。
Anthropic宣布推出Claude Tag,这是一项新的企业级功能,将Claude AI模型直接集成到Slack工作区中。该工具作为团队频道中的积极参与者,通过访问共享信息来协助实时协作、分析任务和团队项目管理。该产品的发布通过将模型更接近集成的企业工作区助手,扩展了Claude的实用性。
OpenAI宣布与Samsung建立战略合作伙伴关系,将其生成式AI技术和大语言模型直接集成到Samsung的消费电子生态系统中。该合作旨在将先进的AI能力部署到手机、个人电脑和家用电器中。此次部署重点在于实现本地化设备端处理,改善生产力工作流,并实现直观的用户交互。
Kling AI发布了Kling 3.0 Turbo,这是其生成式视频平台的优化迭代版本,现已在SocialSight上可用。该更新修改了底层架构,在不牺牲整体输出保真度的情况下提供更快的处理时间并降低生成延迟。该版本保持了标准的风格控制和运动一致性,旨在满足需要高效、高保真自动化视频生成的创作者需求。
Google DeepMind的研究人员引入了一种通过数学反转贝尔曼方程,从智能体的价值函数中恢复其内部世界模型的方法。该方法解码了在强化学习过程中形成的潜环境理解。通过将价值输出与隐藏的环境感知联系起来,该技术旨在提高强化学习研究中的透明度、模型对齐和架构可解释性。
Sakana AI正式发布了Fugu技术报告及详细的模型发布说明。文档概述了该模型的设计理念、性能基准和底层系统架构。作为AI开发者和研究人员的开放资源,该出版物提供了Fugu项目开发周期中实现的实验发现和结构效率见解。
本技术概述详述了通用语言模型(GLM)系列开发商——智谱AI的企业轨迹和技术里程碑。分析探讨了智谱AI在工程化区域性基础模型中的作用及其对大语言模型商业格局的影响。报告详细介绍了GLM语言架构的核心设计,并追踪了其在复杂自然语言应用中的部署情况。
研究人员引入了SelfCompact,这是一种无需训练的脚手架框架,旨在缓解LLM智能体中的上下文窗口爆炸问题。SelfCompact不依赖于死板的基于Token阈值的上下文修剪,而是为模型配备了一个压缩工具来总结其历史,并辅以轻量级的决策准则来触发压缩。在七个开源模型上对六个数学推理和智能体搜索基准进行评估后,该方法将数学准确率提高了18.1点,搜索任务性能提高了5到9点,同时实现了每个问题30%到70%的Token成本降低。
研究人员提出了PolicyTrim,这是一种基于强化学习的后训练框架,旨在提高视觉-语言-动作(VLA)模型在机器人任务中的部署效率。PolicyTrim通过采用动态探索策略来扩展预测动作块的可靠执行长度,并结合冗余感知奖励来最大限度地减少不必要的物理步骤,从而解决不可靠性和物理动作冗余问题。在三个基准测试和三个VLA模型上,该框架将动作块利用率提高了3倍,物理执行步骤减少了51.4%,在不降低成功率的情况下实现了最高5.83倍的端到端机器人部署加速。
为了解决在动态现实环境中训练手机操作智能体的挑战,研究人员开发了PhoneBuddy,一套专门的训练方法和开源模型系列。PhoneBuddy结合了一个名为PhoneWorld的模拟App环境和真实的Android应用程序。训练过程先后应用监督微调和混合强化学习方法。在针对物理手机进行的150项任务评估中,模型在监督微调后的成功率从36.67%提升至混合强化学习后的45.33%,并在AndroidWorld基准测试中达到了83.2%的成功率。
本文探讨了大语言模型中思维链(CoT)蒸馏的计算限制。通过对3B到671B参数的模型进行系统实验,作者证明:虽然算术等前向可计算过程易于迁移(准确率达到0.99以上),但像隐形算术(cryptarithms)这样的回溯搜索任务却无法可靠地进行训练。即使在广泛的强化学习、自我训练和多样的CoT架构下,回溯搜索的蒸馏准确率仍限制在0.01到0.07。研究将基于搜索的推理隔离为左向右自回归序列模型的一个基本瓶颈。
研究人员推出了Vera,这是一种创新的分层视频扩散模型,旨在解决生成式视频编辑中的内容保持问题。与重生成整个像素帧的传统系统不同,Vera生成一个单独的编辑层和一个Alpha遮罩,以便在原始源素材上干净地合成编辑内容。该架构将文生视频的扩散Transformer扩展为混合Transformer(MoT)设计,通过联合自注意力实现交互。在包含486,000个分层帧的高质量数据集上训练后,Vera展现了较传统开源方案更具竞争力的编辑质量和出色的内容保持能力。
本研究描述并诊断了“过早承诺”,这是一种常见的失败模式,即长视野智能体过早确定推理轨迹而无法纠正错误。研究人员将代表性承诺定义为跨运行隐藏状态的相似性,并证明它在Llama-3.1-70B和Qwen-2.5-72B等模型中可作为轨迹收敛的早期指标。使用激活状态,运行时监控器预测轨迹一致性的AUROC高达0.97。测试时提示干预成功降低了智能体28%的行为方差,且不影响下游准确率,证明了其在跟踪隐藏进程故障方面的价值。
本文提出了“连接点”(Connect the Dots, CoD),这是一个用于训练大语言模型以支持长周期智能体部署的通用框架。在CoD框架下,智能体必须解决序列任务、自主探索环境、从错误中学习并迭代更新其操作上下文。作者设计了一种具有细粒度信贷分配功能的GRPO式强化学习算法,优化了穿插任务解决和上下文更新步骤的部署。实证结果验证了CoD训练成功诱导了预期的元能力,并在不同操作领域表现出强大的分布外泛化性能。
为解决文生图模型对齐中的反向传播困难,作者引入了FlowBP,一个统一的代理轨迹框架。FlowBP通过将无梯度缓存回放用于采样,结合由缓存和重新前向计算的速度构建的轻量级后向代理路径,将采样与优化分离。该方案隔离了关键设计参数,包括集成权重和桥接耦合。三个实例变体—FlowBP-Sparse、FlowBP-Bridge和FlowBP-Lagrange—成功通过活动集大小限制了训练内存并减少了梯度链接,在SD3.5-M、FLUX.1-dev和FLUX.2-Klein-base模型上提升了质量和构图指标。