NO/FOMO

每天一次,过滤 AI 噪音

值得打开的
AI 日报。

发布日期2026-07-01中文版本
本期阅读
—
累计阅读
—

AI Blog

2 stories
01

出口管制解除后,Claude Fable 5 和 Mythos 5 重新部署

Anthropic 宣布在其平台(包括 Claude.ai、Claude Platform、Claude Code 和 Claude Cowork)上恢复并全球重新部署其 Claude Fable 5 和 Mythos 5 模型。此决定源于美国政府取消了原定于 6 月 12 日实施的临时出口管制。此外,Anthropic 正联合亚马逊、微软和谷歌建立名为 Project Glasswing 的共享行业框架,以系统化地解决模型越狱和安全保障问题。

02

GeneBench Pro:评估 AI 在基因组学和生物学研究中的表现

OpenAI 推出了 GeneBench-Pro,这是一款旨在测试 AI 在基因组学、生物学和科学研究中表现的新基准。该基准使用复杂的现实世界数据集来评估在 DNA 序列设计、功能预测和生物推理等敏感科学领域的能力。研究机构和生物技术合作伙伴正部署此套件来衡量模型局限性并建立安全边界,确保 AI 在实验室环境中的可靠部署。

Hacker News

6 stories
01

Claude Fable 5 推广访问权限

Anthropic 为其最新的高性能大型语言模型 Claude Fable 5 推出了推广访问计划。该模型针对高级推理、对话任务和智能体工作流进行了优化。该计划允许选定的开发者和企业评估模型能力、运行基准测试并执行安全评估。此举在科技界引发了广泛关注。

02

ZCode:来自 GLM 团队的 Claude Code 竞品

ChatGLM (GLM) 系列大型语言模型的开发团队推出了 ZCode,这是一款专业的 AI 编程助手和开发者工具。该工具基于 GLM 架构构建,为软件开发者提供深度代码智能、多文件上下文理解以及旨在与 Anthropic 的 Claude Code 竞争的智能体代码生成功能,旨在简化代码库分析、自动化调试及复杂系统重构任务。

03

利用 GPU 快照减少 gVisor 冷启动

Cerebrium 引入了一项新技术,利用 gVisor 和内存快照技术来减少无服务器环境中的 GPU 冷启动。该方法在初始化过程中直接从内存捕获 CUDA 工作负载的运行状态并瞬间恢复,绕过了加载模型和权重的缓慢启动阶段,使实时、按需的 GPU 推理扩展变得实用且经济高效。

04

Launch HN: Parsewise (YC P25) – 通过 API 实现跨文档推理

来自 YC P25 孵化项目的初创公司 Parsewise 发布了一个 API,旨在将非结构化文档转换为符合模式的 JSON 或 CSV 输出。该平台通过建立可靠的数据 ETL 流水线,解决了大型语言模型在延迟、成本、容量限制和验证错误方面的常见缺陷,支持跨多文档保持数据血缘关系、实时输出验证以及让业务专家参与模式定义。

05

Show HN: AnalystAIPack – 118 个用于恶意软件分析与逆向工程的可运行智能体技能

Melted in Hex 发布了 AnalystAIPack,这是一个包含 118 个可运行技能的安全工具包,专为从事恶意软件分析和逆向工程的 AI 智能体设计。该工具包连接了大型语言模型与安全运维,使自动化智能体能够反编译代码、检查二进制文件并发现漏洞,为网络安全团队提供了构建自主威胁检测系统的开发者友好工具。

06

Monetization Gateway (变现网关)

Cloudflare 推出了 Monetization Gateway,这是一种网络基础设施解决方案,帮助网络发布者管理、许可并变现来自 AI 机器人和抓取工具的内容访问请求。该服务允许发布者制定细粒度的访问策略、执行小额交易并与 AI 开发者签订许可协议。通过在 Cloudflare 网络边缘运行,该网关有助于在生成式 AI 时代保护创作者的知识产权。

Twitter

8 stories
01

Anthropic 重新发布带有增强网络安全防护的 Claude Fable 5

Anthropic 宣布全球重新发布 Claude Fable 5 模型,并根据与美国政府的磋商更新了网络安全防护措施。该模型包含一套用于识别和拦截网络威胁相关请求的新分类器。尽管标准编程协助保持不变,但用户可能会遇到触发高度敏感分类器的情况。为此,Anthropic 在 Claude Code 中引入了内置 /feedback 命令以协助模型校准。

02

GeneBench-Pro 发布,用于测试专家级计算生物学分析

OpenAI 总裁 Greg Brockman 宣布发布 GeneBench-Pro,这是一款旨在评估 AI 处理计算生物学中复杂、高判断任务能力的基准。该基准模拟了通常需要人类领域专家 20 到 40 小时密集工作的科学工作流。GPT-5.6 Sol 模型的评估结果凸显了其在解决需要深度分析推理而非简单信息检索的复杂领域特定挑战方面的巨大进步。

03

AdaJEPA 模型整合自适应控制与模型预测能力

Yann LeCun 及其研究团队推出了 AdaJEPA,这是一种旨在将 LeWorld 模型转变为自适应系统的机器学习架构。通过整合模型预测控制 (MPC),该框架实现了在动态物理环境中的复杂动作规划和决策。这是联合嵌入预测架构的一大进化,超越了静态数据处理,连接了高层概念理解与底层物理控制。

04

Runway 与 Bertelsmann 合作集成生成式 AI 技术

Runway 宣布与全球传媒集团 Bertelsmann 建立战略合作伙伴关系,在其国际业务组合中部署生成式 AI 工具。集成目标包括 RTL Group、BMG 和 Bertelsmann Marketing Services 等核心实体。通过将生成式视频和媒体生产工具直接嵌入专业工作流,旨在简化创作流程、提高生产效率并扩大内容分发。

05

ARC-AGI-3 挑战为标准 AI 架构设置了重大障碍

Francois Chollet 指出,ARC-AGI-3 基准已成为现代 AI 系统的重大屏障,常规扩展法则和标准架构难以解决该问题。该基准要求独特的认知问题解决能力,这与例行模式识别和检索任务截然不同。解决 ARC-AGI-3 被视为研究社区试图超越静态数据处理、转向通用推理能力的关键里程碑。

06

Kling AI 制作的电影《The Last Real Man》荣获 2026 年戛纳狮子奖

由 Sebastian Strasser 执导、Kling AI 驱动的短片《L'Ultimo Uomo Reale》(The Last Real Man) 在 2026 年戛纳国际创意节上赢得了银狮奖和铜狮奖。这一成就突显了高级生成式 AI 模型加速集成到专业、高端电影摄影和广告工作流中,证明了它们在全球顶级创意产业中的竞争实力。

07

Bloome 发布协作 AI 智能体团队共享工作区

Francois Chollet 介绍了 Bloome,这是一个协作平台,允许用户在一个共享工作区中集成包括 Claude、ChatGPT 和 Gemini 在内的多个高级语言模型,并协同人类合作伙伴。该平台专注于跨智能体反馈循环的部署和编排,以优化迭代、复杂的工作流,满足了专业开发环境中对多智能体系统协调的迫切需求。

08

引入 VISReg:一种用于世界模型和自监督学习的新方法

研究人员引入了 VISReg,这是一种旨在改善自监督学习系统和生成式世界模型的新方法。VISReg 解决了训练过程中经常损害潜空间架构表现的表征坍缩问题。通过稳定训练动态并增强特征提取,该框架使智能体能够学习到更具判别性、更有意义的内部表征,无需依赖大量的监督标签即可解读复杂的真实世界数据。

huggingface

8 stories
01

带有元认知反馈的强化学习可激发大语言模型忠实的不确定性表达

研究人员引入了带有元认知反馈的强化学习 (RLMF) 范式,改善了大语言模型 (LLM) 评估和表达自身能力的方式。RLMF 利用模型自我判断的质量来优化偏好优化过程中的完成排名。这种两阶段解耦方法在将信心评分映射到自然、上下文自适应的语言不确定性之前,校准了模型的自报信心分数。在评估中,RLMF 在多项任务中实现了最先进的忠实校准,优于标准强化学习。

02

SWE-INTERACT:将 SWE 基准重构为用户驱动的长期编码会话

研究人员推出了 SWE-Interact,这是一个旨在评估现实、多轮、交互式开发者会话中软件工程智能体的新基准。与预先提供完整指令的静态基准不同,SWE-Interact 使用用户模拟器,从模糊需求开始,并根据智能体的工作进度逐步揭示反馈和限制。测试显示,顶级模型在单轮任务中表现良好,但在 SWE-Interact 的交互式任务中成功率大幅下降,凸显了处理模糊性和过度智能体化编码错误所面临的挑战。

03

TRIAGE:智能体强化学习的角色类型信用分配

为解决仅关注结果的强化学习的局限性,研究人员提出了 TRIAGE,一种用于智能体强化学习的角色类型信用分配框架。TRIAGE 使用结构化判别器将动作片段分类为进度、探索、基础设施或回归,并将这些类别映射到分段的过程奖励。在 ALFWorld、Search-QA 和 WebShop 上的评估表明,TRIAGE 成功提高了任务成功率,改进了策略梯度,并减少了环境交互步骤。

04

进化微调 (EFT):学习跨 371 个优化任务进行探索

研究人员提出了进化微调 (EFT),这是一种训练中期的范式,旨在教导大语言模型迭代地演进复杂优化任务的解决方案,而非从头开始寻找搜索脚手架。作者编制了包含 156K 条轨迹的 Finch Collection 数据集。在 22 个留出任务中,EFT 模型展现了泛化能力,平均表现优于基础模型,并在与测试时强化学习结合时,在数学和计算问题上达到了最先进水平。

05

分层实验智能体 (HExA)

为了解决新领域中静态知识的局限性,研究人员引入了分层实验智能体 (HExA),这是一种从主动实验中学习的上下文内自提升框架。HExA 通过设计、模拟和细化实验来编译可重用的技能库,无需外部监督。在物理模拟基准 Interphyre 上的评估显示,HExA 将 Claude Sonnet 4.6 在挑战性任务上的成功率从 2% 提高到了 77%,并展现了明确的泛化能力。

06

Xiaomi-GUI-0 技术报告

小米发布了关于 Xiaomi-GUI-0 的技术报告,这是一款针对真实移动环境优化的原生多模态 GUI 智能体。考虑到模拟或离线基准无法模拟物理设备变量,团队实现了以真实设备为主导的混合执行基础设施。该模型利用涵盖高频任务和错误驱动恢复轨迹的数据集,通过监督微调以及步骤级和智能体级强化学习进行精炼,在 RealMobile 平台上实现了 72% 的成功率。

07

MOPD:用于 LLM 后训练中能力集成的多教师在线策略蒸馏

为了解决后训练中组合专门能力时的冲突,研究人员提出了多教师在线策略蒸馏 (MOPD)。MOPD 训练多个独立的、专门的强化学习教师,并在学生模型自身的在线部署中将其专业知识蒸馏给学生,消除了暴露偏差。MOPD 在后训练流水线中保留了几乎所有原始教师的能力,并已成功应用于 frontier 规模的工业模型 MiMo-V2-Flash。

08

MemLearner:学习为视频世界模型查询上下文记忆

为了解决长视频生成中的场景不一致问题,研究人员开发了 MemLearner,这是一种针对视频世界模型的基于学习的自适应上下文查询方法。MemLearner 使用查询标记来桥接上下文和预测标记,无需从头开始训练新架构即可利用预训练的视觉先验。通过新收集的长视频数据集,MemLearner 在复杂遮挡和动态对象运动下展现了卓越的场景一致性和记忆保留能力。