NO/FOMO

每天一次,过滤 AI 噪音

值得打开的
AI 日报。

发布日期2026-06-02中文版本
本期阅读
—
累计阅读
—

AI Blog

8 stories
01

提交拟议 IPO 的保密 S-1 注册草案

Anthropic 宣布已向美国证券交易委员会 (SEC) 提交了一份关于拟议首次公开募股 (IPO) 的保密 S-1 表格注册声明草案。此次提交使这家人工智能安全与研究公司在完成 SEC 标准审查流程后,拥有公开上市的选择权。目前尚未确定发行的具体时间、价格区间和总股份数,因为 IPO 仍需视市场条件而定。该公告根据《1933 年证券法》第 135 条发布。

02

在密歇根州构建智能时代的基础设施

作为其 Stargate 基础设施计划的一部分,OpenAI 正式动工建设位于密歇根州的吉瓦(GW)级数据中心设施。此举旨在构建先进的计算基础设施,以支持下一代人工智能系统海量的算力需求。OpenAI 预计该基地将提升技术产能,并通过在当地创造就业机会促进区域经济增长。该项目旨在扩展硬件资源,以推动大语言模型及其他智能能力的进步。

03

利用 AI 代理寻找编译器误编译错误

SemiAnalysis 研究员 Justin Lebar 展示了自主 AI 代理如何通过自动化编译器模糊测试来发现软件漏洞。在一个下午的时间里,Lebar 耗资超过 10,000 美元运行由 OpenAI Codex 和 Anthropic Claude 驱动的代理,在 LLVM 中发现了数十个合理的错误,并在 NVIDIA 的闭源 ptxas 低级编译器中发现了 80 个误编译程序。使用 ChatGPT 5.5 编写和调整模糊测试器有助于避免重复的错误陷阱,而初步测试显示 Anthropic Claude Opus 4.8 和 Claude Code 的“超级代码”模式将寻找中高严重性漏洞的成本降低了约 80%。

04

将 Project Glasswing 扩展至 150 个新组织

Anthropic 宣布将其协作软件安全计划 Project Glasswing 扩展至 15 个国家的约 150 个新组织。这些合作伙伴涵盖医疗保健、电力、水利、通信和硬件等关键基础设施行业。该计划此前曾与 50 个合作伙伴使用 Claude Mythos Preview 模型,识别出超过 10,000 个高严重性或关键安全漏洞。随着扩展,Anthropic 还重点介绍了 Claude Security——一款利用 Claude Opus 4.8 的代码库扫描和修补工具,并开始向受信任的安全团队提供漏洞发现工具。

05

介绍 Db9.ai:专为 AI 代理构建的无服务器 Postgres

Ed Huang 推出了 db9.ai,这是一个专门为自主 AI 代理设计的工作空间——无服务器 Postgres 数据库。与为人类开发者设计的传统托管数据库不同,该平台将 SQL 表、文件、向量、作业和环境分支整合到一个统一的工作空间中。这种架构允许 AI 代理通过命令行界面即时执行操作,无需复杂的云基础设施设置。显著特性包括用于存储文件与数据库表的 fs9,以及用于安全隔离、测试和执行复杂代理行为的环境范围分支。

06

Anthropic Claude 在 Amazon Bedrock 上的增长推动 AWS 利润率提升

亚马逊云科技 (AWS) 的息税前利润 (EBIT) 利润率环比增长了 213 个基点,主要受客户通过 Amazon Bedrock 使用 Anthropic Claude 模型的需求推动。据 SemiAnalysis 分析,这种利润率的优异表现与竞争对手云提供商持平或下降的利润率形成鲜明对比。增长根源在于 AWS 在第三方模型 API 支出中的主导地位、独特的“代币即服务”业务模式、快速的数据中心电力采购,以及利用定制 Graviton 和 Trainium 硅芯片的深度垂直集成。

07

编码代理的兴起使软件工程转向协调管理

Lorin Hochstein 分析了自主编码代理的兴起如何将开发者从主动编写代码者转变为多个并行 AI 代理的管理者。该文章类比了高性能计算网络互连瓶颈和线程池性能退化,强调了随着代理数量的增加,协调成本如何迅速升级。开发者角色的这种转变与中层管理人员裁员的行业趋势相吻合,这增加了剩余工程师的管理跨度。预计在日常工程工作流中,管理多个编码代理以及人类同事将带来显著的协调开销。

08

Codex 正在改变生产力和知识工作

OpenAI 发布了《知识工作新时代》报告,详细介绍了其 Codex 模型如何在非技术专业领域重塑生产力。报告概述了 Codex 如何在最初的软件开发范围之外,应用于 AI 驱动的研究、数据分析、工作流自动化和内容创建。通过自动化重复性的行政和分析任务,Codex 让员工能够专注于高层面的问题解决。这一转变说明了 Codex 已从开发者工具演变为更广泛的业务运营和数字工作流的生产力引擎。

Hacker News

8 stories
01

Anthropic 将 Claude Mythos 扩展至 15 个国家的关键基础设施

Anthropic 已部署其最先进的 AI 模型 Claude Mythos,用于管理和优化 15 个国家的关键基础设施系统。该模型专为高度敏感和受监管的行业设计,通过处理实时遥测数据来预测系统故障并自动安排电网、水处理设施和公共交通网络的维护工作。此次推广将先进的自然语言理解和实时推理安全护栏整合到国际网络安全框架和公共服务运营中,推动了代理式 AI 工作流的落地。

02

微软发布基于 OpenClaw 构建的自主 AI 代理 Scout

微软宣布推出 Scout,这是一款基于开源 OpenClaw 框架构建的自主人工智能代理。Scout 设计为在后台持续运行的常驻助手,标志着从被动聊天机器人向执行多步工作流的活跃系统的转变。尽管其定位是提升工作场所生产力,但泄露的内部文件显示其战略目标是促进高用户参与度。此举在 Hacker News 上引发广泛讨论,释放出进军自主代理市场的积极信号。

03

特朗普在数周政策反转后签署缩减版 AI 行政令

在经历数周的行政政策反转后,特朗普总统签署了一项缩减版行政令,重点关注人工智能创新和国家安全。该指令旨在加速前沿 AI 技术和高性能计算能力的部署,同时建立安全准则以保障基础设施。通过缩小政策范围,该行政令建立了一个监管框架,旨在促进公私合作,且不对国内科技行业施加过于严格的限制。

04

MAI-Thinking-1 发布

微软发布了 MAI-Thinking-1,这是一项以推理为核心的 AI 计划,同时推出了七款旨在作为专业“爬山算法(hillclimbing)”机器运行的新 MAI 模型。该架构专注于迭代优化和计算推理过程,以动态提升系统性能。此外,发布内容还包括 MAI-Code-1-Flash,这是一个针对开发者工作流中快速代码生成、自动补全和调试进行优化的模型。该系列产品旨在实现低延迟的复杂问题解决与自动化优化。

05

扩展 Project Glasswing

Anthropic 宣布扩展 Project Glasswing,该计划旨在提升前沿人工智能模型的可解释性、安全性和透明度。随着深度学习网络的扩展,理解其内部机制仍是一个关键瓶颈。该项目部署机械可解释性技术来映射和控制神经路径。通过加大研究工程资源投入,Anthropic 旨在发掘神经解码和表征工程方面的新方法,并为自主代理建立审计基准。

06

重新思考:将搜索定义为代码生成

Perplexity Research 引入了一个框架,将网络搜索过程概念化为动态代码生成任务,而非静态检索任务。通过利用大语言模型编写和运行编程指令,该系统能够实时动态地抓取、过滤和处理网络规模的数据。这种方法实现了多步推理和精确的数据操纵,从而提高了准确性和检索相关性,为下一代搜索代理确立了新范式。

07

在 AMD MI300X 上部署 DeepSeek-V4-Flash

本技术报告记录了在 AMD MI300X 企业级 GPU 硬件上部署和优化 DeepSeek-V4-Flash 大语言模型的过程。测试概述了 AMD ROCm 软件栈作为 NVIDIA CUDA 替代方案的兼容性,展示了如何解决库依赖问题并配置内存分配。结果表明,AMD MI300X 是在低延迟生产环境中运行大规模语言模型的有效硬件加速器。

08

GitHub Copilot App

GitHub 推出了 GitHub Copilot App 的预览版,这是一个集成开发应用程序,将生成式人工智能功能直接嵌入到编程环境中。作为智能伴侣,该工具利用在公共代码仓库上训练的先进生成式 AI 模型,提供实时建议、上下文辅助和代码自动补全。该应用程序旨在通过深度生态系统集成,最大限度地减少重复性的样板代码编写,并优化现代软件开发管道。

Twitter

5 stories
01

Anthropic 将 Claude Mythos Preview 扩展至全球组织

Anthropic 已正式扩展其 Project Glasswing 计划,允许 15 个国家/地区的约 150 个额外组织访问 Claude Mythos Preview 模型。这一战略性推广使全球多元化的实体能够整合、测试和尝试这些先进的预览模型功能。此次扩展标志着 Claude 基础设施规模化以及收集国际开发者反馈的一个关键里程碑。

02

Google DeepMind 发布用于高级研究突破的 Co-Scientist

Google DeepMind 推出了 Co-Scientist,这是一种专为科学发现而设计的新型专业人工智能代理,旨在充当科研合作伙伴。该系统集成了先进的机器学习技术,能够实现复杂分析任务的自动化,浏览海量数据集,并与人类研究人员一起简化实验设计。这一举措标志着利用代理式研究模型进行系统性科学创新迈出了重要一步。

03

为 Claude Code 实现自校正反馈循环

Claude 开发者发布了一份指南,探讨了自校正反馈方法,使 Claude Code 能够对其自身输出进行内部验证。通过将人工验证步骤直接编码到代理工作流中,开发者可以建立闭环反馈机制,在无需持续人工干预的情况下提高自主代码执行的可靠性和准确性。

04

OpenAI 模型现已通过 Amazon Bedrock 基础设施提供

OpenAI 已将其先进的大语言模型集成到 Amazon Bedrock 基础设施中。该合作伙伴关系允许企业开发者直接通过 AWS 云环境部署 OpenAI 模型,利用亚马逊的可扩展性、安全性和治理标准,简化模型部署,保持严格的数据合规性,并降低运营延迟。

05

Kling AI 推出世界杯主题互动视频生成功能

Kling AI 推出了全新的世界杯互动式生成视频功能,使用户能够生成个性化的助威和舞蹈视频。此次发布利用了 Kling 先进的生成式视频合成技术,展示了多模态创作的易用性,让球迷能够通过自动化动画工具与赛事主题进行动态互动。

huggingface

8 stories
01

多代理计算机使用 (Multi-Agent Computer Use)

研究人员提出了多代理计算机使用 (MACU) 框架,旨在克服单代理计算机使用系统的局限性。MACU 使用一个经理模型将复杂任务分解为有向无环图 (DAG),并派遣子代理并行执行节点,同时持续更新计划。在 OSWorld、Online-Mind2Web、WebTailBench 和 Odysseys 上的测试表明,与单代理基准相比,MACU 框架的任务完成率提高了 3.4% 至 25.5%,并且在长时程 Odysseys 基准测试中执行速度加快了约 1.5 倍。

02

OpenWebRL:揭秘针对视觉 Web 代理的在线多轮强化学习

研究人员开发了 OpenWebRL,这是一个开放框架,旨在利用在线多轮强化学习 (RL) 直接在实时网站上训练视觉 Web 代理。该框架包括实时浏览器基础设施、监督初始化和轨迹级别的成功评估。利用此设置,团队仅用 400 条初始化轨迹和 2,200 个开放式 RL 任务就训练了 OpenWebRL-4B。OpenWebRL-4B 确立了新的开源技术标杆,在 Online-Mind2Web 上取得 67.0% 的成功率,在 DeepShop 上取得 64.0% 的成功率,优于之前的开源代理,并保持了与专有系统的竞争力。

03

MCP-Persona:通过环境模拟对现实世界个人应用中的 LLM 代理进行基准测试

为解决个性化工具缺乏专门评估的问题,研究人员推出了 MCP-Persona,这是第一个使用模型上下文协议 (MCP) 在模拟个人应用中评估大语言模型代理的基准测试。MCP-Persona 涵盖了 Reddit、小红书、飞书和 Slack 等平台,评估代理如何处理本地数据库和个人账户。实验结果表明,当前最先进的模型在个性化工具交互方面表现不佳,凸显了在定制化、以用户为中心的环境中存在显著的性能差距。

04

ESPO:早停近端策略优化 (Early-Stopping PPO)

研究人员提出了 ESPO (早停近端策略优化) 以减轻大语言模型中标准强化学习的计算浪费和噪声。ESPO 通过从采样 Logits 计算出的代理后悔值 (surrogate regret) 对轨迹进行实时监控,并在检测到失败时提前终止 rollout。该技术在无需外部奖励模型的情况下,将负的时序差分 (TD) 误差集中在失败点附近。在 DeepSeek-R1-Distill-Qwen-7B 的数学推理评估中,ESPO 在 AIME 2024 (46.28% vs 45.25%) 和 MATH-500 (87.42% vs 85.43%) 上优于标准 PPO,同时将 rollout 的 Token 使用量减少了 20% 以上。

05

LongLive-RAG:用于长视频生成的通用检索增强框架

为解决自回归视频合成中的身份漂移和累积误差,研究人员开发了 LongLive-RAG 检索增强生成框架。LongLive-RAG 不仅依赖局部滑动活跃窗口,还将先前生成的潜空间表征视为内容可寻址的历史记录,通过查询嵌入检索相关上下文。它结合了窗口时间增量损失来抑制冗余的局部相似性。在多个自回归骨干网络中,LongLive-RAG 减少了长视频生成过程中的误差累积,并在 VBench-Long 基准测试中排名第一。

06

LVSA:用于长视频扩散的免训练稀疏注意力

研究人员引入了长视频稀疏注意力 (LVSA),这是一种专为视频扩散 Transformer 设计的免训练、块稀疏注意力机制,旨在绕过稠密注意力的二次内存成本。LVSA 结合了结构化窗口模式与旋转全局锚点,以消除长程时间循环伪影。该方案构建在 FlashInfer 内核上,在 Wan 2.1 1.3B 上实现了高达 3.17 倍的计算缩减,并支持在单 GPU 上以 2 倍视界在 HunyuanVideo 1.5 上生成,解决了内存溢出问题。作者还发布了 VQeval 以准确评估视频伪影故障。

07

线性集成可消除水印:论 LLM 中分布扰动的脆弱性

一项研究表明,文本水印方案存在重大漏洞,证明多个语言模型的线性集成可以轻易消除统计签名。作者提出了 WASH (通过统计混合进行水印衰减) 以解决跨模型的词汇不对齐和 Token 化差异。对六种水印方案和三种 LLM 的测试表明,仅平均化 3 到 5 个模型的输出,就可将检测 Z 分数从 300 抑制到检测阈值以下,这表明水印技术需要模型提供商之间前所未有的协调才能保持有效。

08

FineVerify:通过细粒度自验证扩展代理搜索的测试时计算

研究人员提出了 FineVerify,这是一个专为扩展搜索代理测试时计算而设计的细粒度自验证框架。FineVerify 将复杂问题分解为可检查的子问题,针对这些特定准则对采样的候补轨迹进行评分,并选择得分最高的候选者。在四个代理搜索基准测试中,FineVerify 在仅采样四条轨迹的情况下,一致地将 GPT-5-mini 的平均准确率提高了 8.2 个百分点,Gemini-3-flash 提高了 5.6 个百分点。此外,在使用 12 个样本时,它使 GPT-5-mini 在 BrowseComp-Plus 基准测试中超越了前沿模型 GPT-5。