NO/FOMO

每天一次,过滤 AI 噪音

值得打开的
AI 日报。

发布日期2026-05-26中文版本
本期阅读
—
累计阅读
—

Hacker News

6 stories
01

Eagle 3.1:EAGLE 团队、vLLM 团队与 TorchSpec 团队的合作成果

这篇技术博文介绍了 Eagle 3.1,这是 EAGLE 团队、vLLM 团队与 TorchSpec 团队之间的一项重大合作计划。此次集成旨在提高大语言模型投机解码的效率。投机解码已成为一种关键的优化技术,可在不影响生成质量的前提下加速模型推理。通过此次三方工程合作,Eagle 3.1 引入了优化的系统集成,利用了 vLLM 的高吞吐服务引擎和 TorchSpec 的专业投机执行框架。这种协同作用显著降低了延迟并提升了每秒生成的 Token 速度。通过弥合算法设计与硬件感知运行时优化之间的差距,此次合作为现代 LLM 部署提供了一种高性能的开源解决方案,为更具响应性的 AI 应用和可扩展的企业级服务架构铺平了道路。

02

一种类睡眠的 LLM 记忆整合机制

本文介绍了一种专门为大语言模型(LLM)设计的创新型类睡眠记忆整合机制。研究人员意识到神经网络常面临灾难性遗忘和长期知识保留效率低下的问题,因此提出了一种模拟生物睡眠的全新训练阶段。在此专门的离线阶段,LLM 会处理并重组近期获取的信息,在加强有价值关联的同时剪枝冗余参数和噪声连接。研究表明,集成这种受生物启发的睡眠周期可显著提升模型的客观事实回忆能力、推理稳定性和整体样本效率。通过从持续主动学习转向平衡的主动-睡眠周期,LLM 展现出类似于人类认知过程的增强型长期记忆整合能力,为开发更健壮、更灵活且更节能的人工智能架构提供了有前景的途径。

03

DeepSWE:一个无数据污染的长程编码智能体基准测试

DeepSWE 作为一个新型且无数据污染的基准测试被引入,专门用于测试和评估长程编码智能体。现代语言模型和软件工程智能体在评估时,往往会因为测试集包含在公共代码库中而遭受数据污染。DeepSWE 通过提供一个干净、隔离的环境来解决这一问题,其中包含完全不受训练数据泄露影响的复杂多步软件工程任务。该基准测试使研究人员能够在长序列编码操作中衡量先进 AI 系统真实的推理、规划和执行能力,为自动软件开发评估建立了一个更可靠的标准。

04

外包加本地化 AI 将比依赖前沿实验室更经济

本文探讨了人工智能行业的一种转变范式,指出外包与本地化开源 AI 模型相结合,将很快提供比依赖专有前沿实验室更具成本效益的选择。虽然专有巨型模型目前主导高端能力,但 API 调用成本和数据隐私担忧使其在可持续商业扩展方面表现不佳。相反,部署本地化、较小规模、经过微调的 AI 架构,并辅以“人在回路”的外包模式,能够创建高效的工作流。这种组合策略使企业在实现相当准确度和任务完成率的同时,显著降低了整体运营支出,保护了敏感数据,并减少了对主流基础模型提供商的依赖。

05

Launch HN:Minicor (YC P26) —— 大规模 Windows 桌面自动化

Faiz 和 Saheed 推出了 Minicor(YC P26 孵化),这是一个旨在使人工智能公司能够快速构建和部署可扩展桌面机器人流程自动化(RPA)解决方案的平台。Minicor 针对缺乏 API 访问权限的遗留系统,例如基于诊所的 Windows 医疗记录系统。传统上,扩展桌面 RPA 一直受限于复杂的脚本编写、动态 UI 变更、编排挑战(包括虚拟机排队和并行化)以及高故障率的困难调试环境。Minicor 通过为桌面环境提供健壮的编排、增强的观察能力和可靠的执行框架,解决了这些持久的自动化障碍。通过降低故障率并简化 VM 编排,Minicor 使现代 AI 智能体和集成平台能够与本地桌面应用程序无缝交互,为遗留系统自动化带来了可扩展性和可靠性。

06

湾区母亲因诈骗者利用 AI 模仿女儿声音损失数千美元

该报道详细说明了一起针对湾区母亲的复杂金融诈骗案,受害者因诈骗者利用人工智能模仿其女儿声音而损失了数千美元。诈骗者利用先进的声音克隆技术执行了一场极其逼真的虚假绑架骗局,该技术仅需一小段音频样本即可实时生成高度逼真的声音模仿。这起事件突显了 AI 驱动的社会工程攻击日益增长且令人担忧的趋势,恶意行为者利用生成式 AI 绕过传统的安全意识并对受害者进行情感操纵。安全专家警告称,高保真合成语音生成工具的快速普及降低了网络犯罪的门槛。该案例强调了提高公众意识、采用诸如口头暗语等家庭安全协议以及开发实时识别合成音频的强大检测机制的紧迫性。

Twitter

6 stories
01

ZoubinGhahrama1_AlphaProof Nexus

Google DeepMind 推出了 AlphaProof Nexus,这是一种创新的智能体框架,旨在利用人工智能推进研究级数学领域的发展。通过利用最先进的智能体能力,该系统旨在解决此前自动化推理工具无法触及的复杂数学问题。这一发展标志着形式逻辑与先进机器学习技术集成的一个重要里程碑,使 AI 能够为高阶数学研究做出实质性贡献。

02

gdb_GPT-5.5 编码能力评测

人工智能行业的知名人物 Greg Brockman 最近分享了他对 GPT-5.5 的积极评估,重点介绍了其在计算机编程领域表现出的出色性能。该推文暗示该模型迭代展现了卓越的编码能力,这可能标志着自动化软件开发和代码生成任务的重大进步,为大语言模型设定了新的性能基准。

03

Google_Gemini AI 更新

Google 已正式宣布对其 Gemini AI 生态系统进行重大更新,重点在于提升模型的性能、速度和多模态能力。最新的改进旨在通过在多元产品套件中集成更先进的推理和处理能力来简化用户交互,展现出更优异的文档理解、实时数据分析和高级代码生成能力。

04

Kling_ai_《House of David》集成

Wonder Project 创始人、《House of David》系列剧(Amazon Prime)创作者 Jon Erwin 公开强调了 Kling AI 在其剧集前两季制作中所发挥的关键作用。据报道,此次合作实现了多项行业首创,展示了先进的生成式视频技术如何融入高预算电视工作流,以增强视觉叙事效果。

05

natolambert_Gemma MoE 呼吁

在最近的一篇社交媒体文章中,AI 研究员 Nathan Lambert 公开呼吁 Google 发布 100B 参数的 Gemma 4 混合专家(MoE)模型。受到 Gemini Flash 3.5 正式发布的影响,Lambert 表示这一高容量开源模型代表了开源社区获取大规模、开放权重架构的一项重要发展。

06

Hailuo_AI_视频生成发布

Hailuo AI 宣布了自动化内容创作领域的突破性能力,展示了该平台在短短 60 秒内生成整季叙事视频内容的能力。通过利用先进的生成模型,该系统显著压缩了复杂视觉故事的制作周期,标志着生成式视频合成领域的一次重大范式转移。

huggingface

6 stories
01

DVAO:用于多奖励强化学习的动态方差自适应优势优化

强化学习已成为使大语言模型与人类意图和任务需求对齐的标准范式。尽管群组相对策略优化(Group Relative Policy Optimization)提供了一种比近端策略优化(PPO)更高效的无值模型替代方案,但在实际的多奖励设置中进行调整仍然具有挑战性。标准的标量化实践存在显著弊端。为解决这些限制,我们提出了动态方差自适应优势优化(DVAO),它根据滚动组内每个目标的经验奖励方差动态调整组合权重,有效地提升具有较强学习信号的目标权重,同时抑制噪声目标。在 Qwen3 和 Qwen2.5 模型上针对数学推理和工具使用基准的广泛实验表明,DVAO 显著优于基准方法。

02

Macaron-A2UI:用于个人智能体生成式 UI 的模型

随着个人智能体逐渐演进以处理复杂的、以用户为中心的任务,静态纯文本聊天正迅速成为瓶颈。生成式 UI 作为必要的全新界面层脱颖而出,能够根据交互上下文实时动态合成正确的控件、选项和状态。我们提出了 Macaron-A2UI,这是一种用于个人智能体生成式 UI 的模型。我们的目标是通过使智能体能够生成自然语言以及用于信息收集、偏好细化、确认和多目标组织的轻量级可执行 UI 操作,从而超越纯文本交互。我们通过基于 LoRA 的参数高效监督微调以及奖励驱动的强化学习,训练了 30B、235B 和 754B 参数的模型。在没有显式方案提示的情况下,最好的 Macaron-A2UI 模型在 A2UI-Bench 上取得了 75.6 的总分。

03

QUEST:使用全合成任务训练前沿深度研究智能体

深度研究智能体将搜索引擎的角色从检索关键词匹配页面扩展到了知识合成。我们发布了 QUEST,这是一系列开源模型(从 2B 到 35B),作为通用深度研究智能体,旨在处理各种长程搜索任务,并在事实寻求、引文验证和报告合成方面具有强大能力。为了构建 QUEST,我们提出了一种有效的训练方法,结合了中间训练、监督微调和基于统一评分树的策划数据合成流水线的强化学习。QUEST 在八项深度研究基准测试中接近甚至超越了前沿闭源智能体。

04

CUA-Gym:扩展计算机使用智能体的可验证训练环境与任务

具有可验证奖励的强化学习(RLVR)在数学、工具使用和软件工程等领域取得了突破,但其扩展到计算机使用智能体(CUA)时,却受限于具有确定性奖励的可扩展训练数据的匮乏。我们提出了 CUA-Gym,这是一个协同生成任务指令、环境状态和奖励函数的可扩展流水线。利用此流水线,我们构建了 CUA-Gym,这是一个包含 32,112 个基于 110 个环境的验证型 RLVR 训练元组数据集。在使用 GSPO 在 CUA-Gym 上进行训练后,我们的智能体在 OSWorld-Verified 上达到了 62.1% 和 72.6% 的准确率,在同等规模下优于此前的开源 CUA。

05

预测与学习:释放主动智能体中的闲置计算资源

尽管 AI 智能体在推理和工具使用方面展现了卓越的能力,但它们在本质上仍是反应性的。为了弥合这一差距,我们引入了 ProAct,这是一种 proactive 智能体架构,利用闲置计算资源来预测并满足用户即将产生的需求。通过分析不断演变的对话历史以及持久记忆,ProAct 能够预测即将到来的需求并迭代获取信息,从而使智能体在用户发起查询之前就能解决知识缺口并准备证据。我们还引入了 ProActEval,这是一个包含 40 个领域、200 个场景的综合基准测试,ProAct 在其中将所需轮数减少了 14.8%,从而加速了任务完成。

06

用于自回归视频生成的策略内对抗流蒸馏

自回归视频生成器对于流式处理、长程和交互式应用极具吸引力,但将强大的黑盒教师模型蒸馏为因果学生模型仍然困难。我们提出了对抗流蒸馏(AFD),这是一个用于异构黑盒视频蒸馏的策略内框架。AFD 对教师进行查询,并让当前学生在相同的提示词上进行训练,训练一个提示词配对的 Bradley-Terry 判别器来估计干净样本下师生之间的差异,并将所得的策略内优势转化为学生自身加噪状态下的前向过程流匹配更新。AFD 在不需要教师分数或反向链强化学习的情况下,提供了密集的速度场监督。