NO/FOMO

每天一次,过滤 AI 噪音

值得打开的
AI 日报。

发布日期2026-06-30中文版本
本期阅读
—
累计阅读
—

AI Blog

3 stories
01

推出具备增强智能体功能的Claude Sonnet 5

Anthropic发布了Claude Sonnet 5,这是一款专为自主工作流、浏览器和终端导航以及规划而设计的智能体大语言模型。在BrowseComp和OSWorld-Verified测试中,Sonnet 5在编码、推理和工具使用方面表现出比Sonnet 4.6显著的进步,同时缩小了与Opus 4.8的性能差距。该模型现已成为免费和Pro用户的默认选项,并可在Max、Team、Enterprise、Claude Code和Claude API层级中使用。在2026年8月31日之前,初始定价为每百万输入Token 2美元,每百万输出Token 10美元,之后将上涨至3美元和15美元的标准费率。

02

为研究人员推出Claude Science AI工作台

Anthropic宣布推出Claude Science,这是一款专业的AI工作台,旨在协助科学家完成基因组学、结构生物学和蛋白质组学方面的复杂研究工作流。该平台配备了一个拥有60多种预配置技能的通用协调智能体,以及用于验证计算和来源引用的专业验证和审查智能体。Claude Science支持生成可复现的产物,并管理本地机器、HPC集群和按需GPU上的计算环境。该系统目前处于面向Claude Pro、Max、Team和Enterprise用户的测试阶段。

03

企业从“Token至上”转向Token预算管理

SemiAnalysis发布的研究显示,企业AI支出正从不受限制的Token消耗转向严格的Token预算控制。继2026年初的大规模使用(例如Uber在四个月内耗尽了年度Claude Code和Codex预算)后,企业开始实施每月从250美元到数万美元不等的支出上限。这种转变正驱动组织降级默认模型并采用更便宜的层级。客户数据分析显示,差距巨大:排名前1%的科技领先客户每年每位员工支出9万美元,而Median Ramp客户仅支出136美元。

Hacker News

8 stories
01

Claude Sonnet 5

Anthropic宣布推出Claude Sonnet 5,这是其最新的先进大语言模型。该版本在逻辑推理、数学计算和代码生成方面有了显著提升。Claude Sonnet 5擅长复杂的指令遵循、多轮对话管理和高级上下文整合,并在标准自然语言处理和Agentic工作流任务中表现出行业领先水平。该模型旨在提升开发者生产力和企业自动化效率,为高效、安全且能力强大的AI系统树立了新标杆。

02

LongCat-2.0,一款总参数1.6万亿、激活参数480亿的大规模MoE模型

LongCat团队宣布了LongCat-2.0,这是一个拥有1.6万亿总参数的大规模混合专家(MoE)语言模型。为保持高计算效率,该模型在推理时仅使用480亿激活参数,在高性能表现与实际部署需求之间取得了平衡。通过选择性激活路由路径,该架构能够处理海量语言任务而无需过高的计算资源。此发布反映了行业向针对高性价比运行而优化的稀疏架构发展的趋势。

03

Claude Code正在给请求添加隐写标记

技术分析显示,Anthropic面向开发者的命令行界面工具Claude Code,在其发出的提示词和API请求中嵌入了隐藏的隐写标记。该工具通过系统指令的空格或格式编码,秘密地将其流量标记为智能体生成。这一发现引发了开发者社区对安全性、数据隐私和透明度的严重质疑。此举使得外部服务器能将Claude Code的请求与标准人类生成的API流量区分开来,凸显了专有AI工具行为中日益紧张的关系。

04

Claude Desktop现已登陆Linux(测试版)

Anthropic发布了适用于Linux操作系统的原生Claude Desktop客户端测试版,为软件工程师、系统管理员和开源倡导者提供了跨平台体验。该客户端提供了一个与macOS和Windows版本功能一致的本地工作空间。主要功能包括与本地系统资源的集成、更快的性能以及绕过浏览器体验的自定义键盘快捷键。此举扩展了Anthropic的多平台战略,以更好地支持在本地环境工作的技术开发人员。

05

Tell HN:在iOS上安装Cursor会不可逆地更改您的隐私设置

一位开发者在Hacker News上反映,登录iOS版Cursor AI编辑器移动应用后,其账户范围内的隐私设置被静默且不可逆地迁移了。用户的账户自动从严格的“隐私模式(传统版)”(确保私有代码不存储在Cursor服务器上)切换到了较宽松的“隐私模式”,该模式允许为了后台智能体使用而存储数据。迁移后,传统模式选项从界面菜单中彻底消失,这引发了关于在使用AI开发平台时出现“深色模式(Dark Patterns)”和数据主权问题的担忧。

06

Nano Banana 2 Lite

Google DeepMind开发了Gemini Flash-Lite,这是一款针对快速、经济高效的图像生成和计算机视觉任务进行了优化的多模态模型。该模型旨在降低延迟和计算开销,支持在标准云基础设施上进行实时处理和低延迟工作流。这种精简的蒸馏版本有助于开发者将多模态功能嵌入Web应用,而无需大型模型通常所需的高额计算资源。此举凸显了行业向部署高效版AI系统以扩大开发者使用范围的趋势。

07

Claude Science

Anthropic宣布推出Claude Science,这是一项旨在利用Claude平台加速先进科学研究和计算工作流的专项计划。该平台集成了最先进的推理、数据分析和技术文档理解能力,帮助研究人员分析复杂数据集并制定假设。通过综合定量数据和解析学术出版物,该工具充当智能助手,简化生物技术、物理学、化学和环境科学的研究。此次发布代表了将大语言模型应用于结构化、高度严谨的科学发现的针对性努力。

08

Zluda 6发布(在非Nvidia GPU上运行未经修改的CUDA应用)

ZLUDA项目发布了其高性能翻译层的第6版,该版本使得未经修改的CUDA应用程序能够在非Nvidia GPU硬件上无缝运行。通过针对AMD和Intel GPU等替代架构,此版本解决了深度学习和并行计算生态系统中的供应商锁定问题。此次更新针对复杂的GPGPU和高性能计算工作负载引入了关键的兼容性和性能优化。这一进展有助于将软件依赖从特定硬件中解耦,为机器学习开发者推动更具竞争力的硬件环境。

Twitter

8 stories
01

Anthropic宣布推出具备增强智能体功能的Claude Sonnet 5

Anthropic正式发布了Claude Sonnet 5,引入了自主智能体功能的显著进步。更新后的模型旨在以更高的自主性运行,通过网页浏览器和命令行界面等集成工具生成复杂的运营计划并在数字环境中执行任务。此次发布旨在弥合逻辑推理与直接工具执行之间的鸿沟,为开发者和企业团队简化自动化任务管理。虽然相关计算机自动化功能仍在开发中,但此次发布为构建交互式、工具使用型AI智能体奠定了稳固基础。

02

Google推出用于视频生成和对话编辑的Gemini Flash

Google正式推出了Gemini Flash,这是一款为高性能和低成本运行而设计的高效多模态模型。该模型专为处理复杂工作流而优化,重点在于先进的视频生成能力和实时对话媒体编辑。通过降低与大型生成式AI工作负载相关的操作延迟和服务成本,Google旨在为开发者生态系统提供用于媒体创作、交互式故事讲述和动态内容操作的可访问工具,而不牺牲处理速度或输出质量。

03

Nano Banana 2 Lite发布,实现四秒内极速文本转图像生成

Google DeepMind推出了Nano Banana 2 Lite,这是一款专为显著加速文本转图像生产流水线而设计的专业生成式AI模型。该优化系统能够在四秒内提供高质量的视觉输出,促进了快速创意构思和精简的设计工作流。此次发布针对低延迟生成需求,使设计师和开发者能够以最小的摩擦从文本提示转变为成品图像,从而提高了数字媒体和专业内容创作流水线的迭代速度。

04

Luma Labs发布Dream Machine 2.0 Mini用于先进视频生成

Luma Labs发布了Seedance 2.0 Mini,这是一款集成在Luma平台画布中的专业视频生成模型。该版本具有更快的生成速度和精细的迭代编辑控件,允许创作者通过文本提示生成高质量视频资产。此次更新通过在统一工作空间内结合创意构思和渲染,简化了生产流程。通过改进直接界面调整和反馈循环,该平台旨在建立适合专业和实验性电影制作人的高效文本转视频生产流水线。

05

掌握AI驱动软件开发的循环工程

吴恩达(Andrew Ng)概述了“循环工程”,这是一种专为构建带自主AI智能体的软件应用而设计的结构化方法。该框架将智能体开发生命周期分为三个功能层:独立迭代和测试代码的智能体编码循环、保持人类上下文监督的开发者反馈循环,以及由现实世界用户数据驱动的外部反馈循环。该模型强调,虽然AI智能体日益自动化了技术实施,但人类判断对于引导产品需求仍然必不可少。

06

Kling AI项目在2026年戛纳国际创意节上荣获三项大奖

Kling AI宣布,使用其生成视频合成工具制作的媒体项目在2026年戛纳国际创意节上获得了三项大奖。荣誉包括电影:消费品类银狮奖,以及电影:B2B类和新设立的AI工艺类的铜狮奖。这一成就证明了专业制作团队对先进的文本转视频工具的商业采纳日益增加,以在主流广告框架内生成广播级营销资产和电影叙事。

07

大语言模型出现创新的长上下文处理技术

研究人员引入了针对长上下文大语言模型(LLM)优化的先进序列处理方法。这些技术扩展了模型上下文窗口,使系统能够摄入、保留和合成规模显著更大的数据集。通过克服物理内存限制,新架构解决了长程依赖问题并支持深度文档解析。这些优化对于构建能够保持对话一致性并在扩展运行周期内处理海量数据负载的可靠AI智能体至关重要。

08

首届致力于世界模型的全球峰会即将在旧金山召开

克里斯托瓦尔·巴伦苏埃拉(Cristobal Valenzuela)宣布,首届专门致力于世界模型开发与研究的峰会将于今年9月在旧金山举行。该技术活动将汇集AI研究人员、工程师和行业领袖,探讨空间推理、环境模拟和预测建模方面的突破。由于世界模型是内化和模拟虚拟及物理物理法则的关键前沿,此次峰会旨在促进在超越传统训练范式的先进架构方面的合作。

huggingface

8 stories
01

扩展地平线而非参数:用35B智能体达到万亿参数性能

研究人员介绍了Agents-A1,这是一款35B混合专家智能体模型,旨在通过扩展智能体地平线来匹配万亿参数模型的性能。其训练配方结合了长地平线知识行动基础设施,产生平均45K Token的轨迹,随后进行三阶段监督微调、领域级教师训练和多教师策略蒸馏。在基准测试中,Agents-A1在SEAL-0 (56.4) 和 IFBench (80.6) 上取得了领先成果,与DeepSeek-V4-pro和Kimi-K2.6等1T参数模型相比极具竞争力。

02

OSWorld2.0:在长地平线现实世界任务中基准化计算机使用智能体

研究人员介绍了OSWorld 2.0,这是一个包含108个长地平线计算机使用工作流的基准,旨在评估高度复杂、现实约束下的自主智能体。该套件中的日常任务和专业任务要求Claude Opus 4.7使用最大思维量时平均进行318次工具调用,而在OSWorld 1.0中仅需30次。在500步限制下,Claude Opus 4.8得分最高,但最终任务完成率仅为20.6%,这表明当前智能体架构存在巨大的性能差距。

03

TACO:用于智能体工具使用的工具增强信用优化

研究人员开发了工具增强信用优化(TACO),这是GRPO强化学习的一个变体,旨在优化多模态代码工具智能体的工具使用。TACO使用了两个耦合的优势通道:差分答案探测奖励(DAPR),基于工具调用对最终正确性的确切影响进行信用归因;以及结果门控优势路由(OGAR),专门将最终结果信用分配给负责的代码段。该设计在不产生外部成本的情况下抑制了冗余和误导性的工具调用。

04

智能体弃权:智能体知道何时停止而不是继续行动吗?

研究人员制定并调查了“智能体弃权”,这是一个评估自主智能体在不确定性下何时应停止工具交互的顺序决策问题。研究覆盖了网络购物、终端环境和QA,评估了13个LLM系统和2个脚手架,分析了28,000个任务,发现更大型、更有能力的模型在适时弃权方面往往表现挣扎。为了解决这个问题,他们引入了CONVOLVE,这是一种将轨迹蒸馏为停止规则的上下文工程方法,使Llama-3.3-70B在WebShop上的适时回调率从26.7提高到57.4。

05

LiveEdit:迈向基于扩散的实时流媒体视频编辑

研究人员介绍了LiveEdit,这是一个专为实时、逐帧编辑且保持内容一致性而设计的新型流媒体视频编辑框架。LiveEdit利用一个三阶段蒸馏管道,将编辑能力从双向基础模型迁移到高效的单向流媒体编辑器。为了支持实时运行,它使用了AR导向的掩码缓存,重用了区域特定的计算。评估表明,该系统在流媒体基准中具备行业领先的视觉质量,推理速度提升至12.66 FPS。

06

DreamForge-World 0.1预览:低计算实时可控世界模型

研究人员发布了DreamForge-World 0.1预览版,这是一个为实时交互模拟设计的自回归、可控世界模型。该系统衍生自Wan2.1-T2V-1.3B并带有残差动作路径,在单台消费级RTX 4090 GPU上实现了480p分辨率下的14至15 FPS。它支持实时键盘/鼠标控制、流中重提示和多模态初始化,为部署本地化交互式模拟器提供了一种高性价比路径。

07

GUICrafter:利用海量未标注屏幕截图的弱监督GUI智能体

研究人员提出了GUICrafter,这是一款通过课程框架训练的弱监督GUI智能体,旨在减少对昂贵人类标注的依赖。在第一阶段,模型直接从未标注的屏幕截图和网页中学习视觉基础;在第二阶段,它通过极少量高质量数据进行强化学习校准。GUICrafter在仅使用UI-TARS 0.1%的标注数据集的情况下,达到了与之相当的竞争性表现。

08

AsyncOPD:策略蒸馏可以有多“陈旧”?

研究人员对LLM后训练中异步策略蒸馏(OPD)的梯度陈旧性进行了系统研究。研究表明,前向KL散度对陈旧rollout具有稳健性,而反向KL则较为脆弱。通过使用本地实时学生更新和多样本蒙特卡洛估计解决此问题,作者引入了AsyncOPD。与同步训练基准相比,AsyncOPD将训练吞吐量提高了1.6倍至3.8倍。