NO/FOMO

每天一次,过滤 AI 噪音

值得打开的
AI 日报。

发布日期2026-07-24中文版本
本期阅读
—
累计阅读
—

AI Blog

2 stories
01

Claude Opus 5 模型发布:实现主动且高性价比的智能

Anthropic 发布了 Claude Opus 5,这是一款专为日常使用设计的主动型大型语言模型,其性能可媲美 Claude Fable 5,价格却仅为后者的一半。作为 Claude Max 的新默认模型,它在知识工作和软件工程方面表现出色。它在 Frontier-Bench v0.1 上超越了竞争对手,以三分之一的成本优于 Fable 5 的 OSWorld 2.0 结果,并在 ARC-AGI 3 上的得分是次优模型的三倍。该模型还在生命科学评估、视觉输出和自我验证任务中表现出显著改进。

02

Codeberg 禁止生成式 AI 代码引发开源社区分歧

Armin Ronacher 分析了 Codeberg 最近的政策更新,该政策禁止托管大部分代码由生成式 AI 工具编写的项目。尽管认可平台实施限制的权利,但 Ronacher 认为“大部分”AI 编写的代码库这一模糊界限会导致版主进行主观执法。他表示,这一立场限制了 Codeberg 成为 GitHub 的广泛且可靠的欧洲替代方案的潜力,特别是在大型语言模型和代理已成为软件开发标准工具的情况下。他呼吁开源社区建设性地参与这些技术。

Hacker News

5 stories
01

Claude Opus 5

Anthropic 推出了 Claude Opus 5,代表了其大型语言模型系列的下一个前沿。该模型随附一份详尽的系统卡片,阐述了其安全概况、训练方法和基准测试结果。Claude Opus 5 展现了顶尖的推理、数学能力和编码水平。它采用了强大的对齐技术,旨在处理复杂且高风险的企业分析任务,同时最大限度地减少幻觉。此次发布标志着人工智能安全和能力方面的重要里程碑,为安全 AI 部署树立了新的基准。

02

Flux 3

Black Forest Labs 正式发布了 Flux 3,这是其最新的文本到图像生成式扩散模型。该版本在图像质量、提示词遵循度、逼真的人体解剖结构渲染、复杂光影处理以及计算效率方面都有显著提升。它提供了开发者友好的 API 集成以及针对本地部署的优化路径。同时发布的还有用于视频动作控制的 Flux 3 X Mimic 模型,代表了开放且易于访问的生成式媒体领域的一次重大发布。

03

Claude Cookbook

Anthropic 推出了 Claude Cookbook,这是一个综合性的开发者资源库,旨在加速 Claude 大型语言模型的集成。该资源提供了实用的指南、代码片段和方案,涵盖了提示词工程、API 参数配置和长上下文管理等主题。它还详细介绍了高级实现方法,包括工具使用、检索增强生成 (RAG)、多模态处理和代理工作流,助力构建复杂的生产级 AI 代理。

04

Nvidia、Microsoft 和 Meta 警告反对过度监管开放权重模型

Nvidia、Microsoft 和 Meta 联合警告政策制定者,反对对开放权重的人工智能模型进行过度监管。在联名信中,这些科技公司认为,开放权重 AI 的开发对于保持美国的科技领先地位、推动学术研究以及普及先进工具的使用至关重要。他们主张监管焦点应集中在应用程序的部署和恶意使用上,而不是对底层权重的开源发布施加严格限制,这凸显了生成式人工智能治理中至关重要的辩论。

05

对 OpenAI 的“流氓黑客代理”故事持怀疑态度

《卫报》发表分析文章,呼吁对 OpenAI 关于“流氓黑客 AI 代理”的说法保持怀疑。文章认为,鉴于当前的技术水平,自动化的、具有自我动机的数字破坏者叙事在技术上是不太可能的。文章建议,这种叙事可能仅是营销手段,旨在夸大当前的 AI 代理能力或转移对以人为本的安全问题的关注。作者呼吁采取更扎实、基于证据的方法来评估 AI 威胁,并强调当前的网络安全风险仍然主要由人为驱动,而非机器主导。

Twitter

7 stories
01

Anthropic 发布具备前沿级智能的 Claude Opus 5 模型

Anthropic 正式发布了 Claude Opus 5,这是其最新的高性能大型语言模型,旨在实现接近前沿的智能。该模型现可通过 Claude API 使用“claude-opus-5”标识符访问,并可集成到 Claude Code 环境中的开发者工作流中。为了协助迁移,开发者可以运行命令“/claude-api migrate”自动更新模型字符串,而内置的 claude-api 技能则针对 Opus 5 架构提供了优化提示词建议。性能方面,该模型在 ARC-AGI-3 推理基准测试中取得了 30% 成功率的全新领先结果。

02

OpenAI 在桌面应用中引入 ChatGPT 语音模式集成

OpenAI 在其桌面应用程序中引入了 ChatGPT 语音功能,允许用户直接从电脑进行实时、流畅的口语对话。此次更新将交互范式从传统的文本提示词转向多模态的语音优先桌面界面。在相关产品更新中,OpenAI 还推出了移动设备上的 ChatGPT Work 功能,旨在为其用户群促进移动办公的网页设计和部署。这些发展强调了 OpenAI 持续致力于简化专业工作流,并在不同设备生态系统中扩展其对话模型的可用界面。

03

通过 JEPA 中创新的 SIGReg 机制推进世界建模

Yann LeCun 强调了自监督学习领域的一项关键技术进展,即在联合嵌入预测架构 (JEPA) 中引入了 SIGReg,这是一种专为 JEPA 设计的新型反坍缩机制。SIGReg 解决了目标函数优化和训练稳定性方面的基础挑战,确保了在不依赖像素级生成重建的情况下进行更稳健的表示学习。通过实施该机制,研究人员提高了基于 JEPA 的世界建模的计算效率,为自主学习代理建立对复杂环境的高层结构理解奠定了基础。这一发展标志着从暴力生成式建模向结构化、预测性机器智能的重大技术转变。

04

Runway Agent 引入复杂的基于节点的任务流自动化

Runway 宣布对其生成式 AI 视频工具进行重大升级,使用户能够使用自然语言提示词生成复杂的、多层的、基于节点的工作流。此次更新抽象了程序化节点网络的复杂手动配置,允许创作者和电影制作人通过纯文本指令编排自动化的媒体生成任务。这一发展是 Runway 发布的最新生成式视频合成系列的一部分,该系列引入了增强的视觉一致性、精确的输出控制和更高分辨率的输出。这些功能旨在降低制作广播级数字内容和进行快速艺术迭代的技术门槛。

05

通过简化系统提示词优化 Claude Code 性能

Claude 开发团队分享了其开发者助手 Claude Code 的提示词优化策略。通过删除现有 Claude Code 系统提示词中约 80% 的内容,工程团队观察到模型速度、行为和任务执行有了显著改进。这种缩减证明,精简的提示词设计对于管理复杂的代理编程工作流非常有效。这些发现表明,开发者可以通过优先考虑简洁性和结构清晰度,而非长系统上下文,在大型语言模型应用中平衡标记使用量与模型性能。

06

Sakana AI 正式发布 Fugu-Ultra 1.1 版本

Sakana AI 正式宣布发布 Fugu-Ultra 1.1 版本,标志着其专用语言模型系列的最新更新。版本 1.1 使用早期模型迭代的反馈开发,在运行时效率和输出准确性方面有所提升。此次发布强调了 Sakana AI 持续的研究战略,即围绕高性能、特定领域模型的定制架构。这次更新是该开发者扩展其模型系列并在竞争激烈的大型语言模型部署领域中提供可靠替代方案的关键一步。

07

ARC AGI 基准测试的下一版本备受期待

人工智能研究社区正准备发布抽象与推理语料库 (ARC AGI) 基准测试的第 4 版。在 Greg Kamradt 的管理下,更新后的套件将引入更严格的评估方法,以测量超越简单模式匹配或基于大型静态数据集训练的抽象机器推理能力。随着模型的演进,该基准测试对于确定现代架构能否在全新的、未见过的任务上实现真正的通用智能和逻辑泛化仍然至关重要。

huggingface

8 stories
01

AREX:迈向递归自我改进的深度研究代理

研究人员推出了 AREX,这是一个通过代理中期训练和长视距强化学习训练的递归自我改进 (RSI) 深度研究代理系列。为了解决复杂的约束问题,AREX 在收集证据和构建答案的内部研究循环与审计声明的外部自我改进循环之间切换。为了在长时间内保持上下文,该代理使用了一个自动工具,将交互历史压缩成紧凑的状态。AREX 在 4B 和 122B 的 Mixture-of-Experts 规模上实例化,在 WideSearch 和 Humanity's Last Exam (HLE) 等基准测试中优于同类基准模型。

02

NVIDIA-labs OO Agents:原生 Python 面向对象代理

NVIDIA-labs 介绍了 NVIDIA 面向对象代理 (NOOA),这是一个旨在构建可靠 AI 代理的模型无关 Python 框架。NOOA 将代理组件直接映射到 Python 结构:操作表示为类方法,状态表示为字段,提示词表示为文档字符串,合约表示为类型注释。留作省略号的方法在运行时由 LLM 驱动的代理循环执行。该框架支持类型输入、实时对象的引用传递以及可编程的循环工程。在测试中,现有模型有效地使用了该接口,在 SWE-bench Verified、Terminal-Bench 2.0 和 ARC-AGI-3 等基准测试中展现了强大的性能。

03

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

研究人员开发了 SANA-Video 2.0,这是一个以 5B 和 14B 参数规模发布的混合视频扩散 Transformer。它旨在单 GPU 上生成最高 720p 的视频,架构使用 Hybrid Linear-Softmax Attention 机制代替了全二次 softmax 注意力,该机制将门控线性注意力与 3:1 比例的周期性 softmax 锚点相结合。它还使用块注意力残差 (AttnRes) 在更深层复用锚点特征。SANA-Video 2.0 在单块 H100 GPU 上以 480p 分辨率在 13.2 秒内达到了 84.30 的 VBench 分数,比全 softmax 基准速度提升了 3.2 倍。

04

Tencent WorkBuddy Bench:具有抗污染任务构建的多领域编码代理基准

腾讯发布了 Tencent WorkBuddy Bench,这是一个针对代码、Web、办公和安全领域编码代理的多领域评估套件。为了防止数据集污染,每个任务都是从实际提交、拉取请求或业务场景中进行逆向工程,并改写为无法通过网络搜索还原的口语化角色扮演请求。开源数据集包含环境图像、评估测试和参考解决方案。该套件通过 CodeBuddy Code 和 Claude Code 评估工具进行测试,旨在跟踪互补的专业技能集合。由于采用领域特定的评分协议,各子集分数将单独报告,不计算全套基准的平均分。

05

从代理经验中进行样本高效学习

研究人员提出了一种经验蒸馏 (Experience Distillation) 方法,这是一种样本高效的学习方法,旨在将代理的交互式试错历史内化到模型权重中,而无需额外的环境交互。在 749 个精选软件工程任务和六个文字冒险游戏中进行的测试表明,经验蒸馏保留了上下文学习性能收益的至少 64.8%,而直接监督微调仅恢复了 3.8%。与标准的强化学习基准相比,将上下文试错与经验蒸馏相结合,在利用比基准少 9.6 倍环境样本的情况下达到了相同的性能水平,从而降低了现实世界交互的高昂成本。

06

LLM 在不断演变的意图中迷失方向

研究人员引入了一个动态测试框架,以评估大型语言模型在多轮交互中如何跟踪和执行不断演变的用户意图。虽然模型通常是在静态的单轮设置中进行测试,但该框架将标准基准转换为多轮对话,其中意图会逐步揭示或修改。在多个任务和主要模型系列的研究发现,从静态环境转变为动态环境时,性能有显著下降。这种失配突显了当前 LLM 在随用户目标随时间改变而保持协作能力方面的关键局限性。

07

具有世界状态寄存器的流式多代理自回归扩散模型

研究人员开发了 WorldWeaver (W^2),这是一种流式多代理视频扩散模型,旨在在多个代理和视角中保持持久的世界状态。与在上下文中携带观察历史的标准自回归模型不同,WorldWeaver 引入了跨代理世界状态寄存器。这些可学习的标记存储共享的环境细节并跟踪各个代理的状态,在每次生成的视频块后进行更新。通过来自全局和俯视视角的监督信号进行接地,该模型采用了具有解耦权重的 Mixture-of-Transformers 架构。双代理 Minecraft 视频生成实验显示了逻辑和视觉一致性的改进。

08

用于 LLM 强化学习的预测散度掩码

研究人员开发了预测散度掩码,这是一种新的信任区域掩码方法,用于稳定大型语言模型的离策略强化学习更新。虽然典型的 PPO 框架依赖于单个标记比率代理,这些代理可能与潜在的概率散度变化不一致,但该方法以闭合形式预测策略梯度步骤是否会降低散度。为了处理仅显示截断词汇表的生产环境,作者设计了两种轻量级的 Top-K 估计器。分析表明,基于散度的掩码改善了跨多种模型规模和精度配置的强化学习训练稳定性。