NO/FOMO

每天一次,过滤 AI 噪音

值得打开的
AI 日报。

发布日期2026-05-29中文版本
本期阅读
—
累计阅读
—

Hacker News

6 stories
01

Mistral AI Now Summit 巴黎峰会笔记

本文概述了在巴黎举行的 Mistral AI Now Summit 的主要见解和公告。峰会重点介绍了 Mistral AI 在开源和商业语言模型方面的最新进展,强调了其为开发者和企业提供高性能、高性价比 AI 解决方案的重点。讨论要点包括专业模型的部署、量化等优化技术,以及支持 Mistral 架构的生态系统发展。此次活动突显了该公司致力于培育一个挑战封闭替代方案的开放生态系统,同时展示了旨在加速全球生成式 AI 技术应用的现实用例、API 增强和战略合作伙伴关系。

02

Liquid AI 发布基于 38T 训练的 8B-A1B MoE 模型

Liquid AI 正式宣布推出其最新模型:一个基于 38 万亿 token 数据集训练的 8B-A1B 混合专家(MoE)架构模型。此次发布突显了该公司致力于开发摆脱传统 Transformer 架构的高效 Liquid 基础模型。通过利用先进的动态系统和状态空间公式,该新模型在实现行业领先性能基准的同时,推理阶段的资源占用显著降低。训练阶段是一个重大里程碑,证明了非 Transformer 设计在处理超大规模数据集时能够有效扩展。此次发布预计将为开发者提供一种在部署复杂 AI 工作流时响应更迅速、更具成本效益的替代方案,为生成式 AI 领域的计算效率树立了新标准。

03

CAPTCHA 依然能够检测 AI 代理

本研究分析了在先进人工智能时代,全自动区分计算机和人类的图灵测试(CAPTCHA)的持续有效性。尽管大语言模型和计算机视觉算法的快速进步威胁到了传统的安全屏障,但现代 CAPTCHA 实现方案在识别和阻断自动化 AI 代理方面依然惊人地有效。通过利用复杂的行为跟踪、动态认知挑战和异常检测,现代安全系统能够区分人类交互与模拟代理工作流。研究突显了 CAPTCHA 设计从静态图像识别向复杂交互式行为分析的演变,为防范未经授权的网络抓取、自动垃圾信息发送和机器人驱动的滥用提供了关键防御层。研究结果表明,虽然基础视觉谜题越来越容易受到机器学习攻击,但自适应挑战响应机制仍然能够有力地检测并缓解网络中复杂 AI 代理的行为。

04

CVE-Bench:在真实漏洞补丁上测试 LLM 代理

CVE-Bench 引入了一个新颖且严谨的基准数据集,旨在评估大语言模型代理在为真实世界通用漏洞披露(CVE)生成软件补丁方面的能力。与合成基准不同,CVE-Bench 利用各种编程语言中的历史真实安全漏洞,测试 AI 代理对代码库推理、识别安全漏洞并生成功能性、安全的代码修改的有效性。该基准旨在弥合理论软件工程能力与实际网络安全部署之间的差距,提供一个标准化的环境来跟踪自动化安全修复的进展。结果强调了当前最先进的 LLM 在处理复杂多文件代码依赖方面的局限性,并突显了成功进行自主网络防御操作需要先进推理架构的必要性。

05

Robinhood 现在允许 AI 代理进行股票交易

Robinhood 推出了一项新功能,允许用户配置的 AI 代理直接在其平台上执行股票交易。这一功能标志着向由 AI 驱动的自主金融交易迈出了重要一步。通过为外部 AI 系统提供安全的 API 集成和编程接口,Robinhood 使开发者和用户能够部署能够分析市场状况并自动执行买卖决策的自主软件。这种集成弥合了去中心化软件代理与传统金融市场之间的鸿沟,为自动算法交易提供了新的基础设施,同时也为实时市场操作带来了独特的监管和安全考量。

06

标准 GPU 上的实时 LLM 推理:每请求 3k token/s

本文概述了一项在标准 GPU 硬件上运行大语言模型(LLM)推理的突破性优化技术,实现了每请求每秒 3,000 token 的惊人处理速度。通过解决标准内存带宽和执行流水线中的关键计算瓶颈,开发团队成功大幅提升了吞吐量。这一性能飞跃是在不依赖专用超高端硬件配置的情况下实现的,使得实时、高速的 LLM 应用能够更容易地用于主流企业部署。该架构通过优化张量并行、内存管理和注意力机制,改变了实时文本生成的范式。最终,这一实现证明了智能结构优化可以极大地普及高吞吐量人工智能服务,为交互式代理行为和即时对话响应开辟了新途径。

Twitter

6 stories
01

全新的 ChatGPT 5.5 模型

OpenAI 领导层宣布正式推出集成到 ChatGPT 平台中的全新 5.5 即时模型。这次发布代表了模型效率和实时处理能力的重大进步,旨在为用户提供更快、响应更迅速的交互。通过引入 5.5 版本,该组织继续迭代其大语言模型架构以优化性能指标和延迟。此更新旨在支持更复杂的推理任务,同时保持 ChatGPT 生态系统所预期的对话流畅度。

02

Google Gemini AI 代理发布

在 Google I/O 开发者大会上,Google 正式推出了 Gemini Spark,这是一款精密的个人 AI 代理,旨在作为 24/7 的数字助手运行。这一新工具使人们能够通过在用户直接监督下代表他们执行任务和采取行动,从而更有效地驾驭数字生活。一个关键的技术亮点是其无缝的跨平台集成,使得该代理能够高效地在移动设备和桌面计算机上运行,甚至在笔记本电脑合上时也能保持功能。此次产品发布代表了 Google 将先进 AI 能力融入日常生产力工作流的重大里程碑。

03

Runway:The Rogue 项目

Runway 展示了短片《The Rogue》的制作幕后花絮,该片由一名开发者在不到一个月的时间内完全使用其 AI 视频平台创作完成。该项目是新倡议 Project Luxo 的基石,旨在调查并演示现代生成式视频技术如何有效地跨越恐怖谷。通过展示高质量的 AI 合成图像,Runway 突显了创意行业在真实感和生产效率方面的重大进步。该倡议强调了公司致力于推动自动化电影制作边界的承诺。

04

Kling AI 展示 RAPHAEL

Kling AI 正式展示了创新 AI 驱动的剧情片《RAPHAEL》的幕后制作。这次展示对 Kling AI 工具在整个电影制作流水线中的实际应用进行了全面深入的剖析。通过将生成式视频技术从最初的创意构思和故事板一直整合到高保真电影画面的制作,该项目展示了生产效率和创意产出的重大提升。

05

LLM 渲染器

John Schulman 强调了渲染器在大语言模型软件栈中的关键作用。渲染器通过将 token 映射到消息,作为基础层确保了跨不同分词器实现和格式约定的的一致性。作者强调,准确的消息处理对于保持 API、数据集和强化学习(RL)环境之间的对齐至关重要。未能有效管理这些细节可能会引入重大的技术风险。

06

llama.cpp 官方发布

llama.cpp 项目的创建者 Georgi Gerganov 正式为这一流行的本地人工智能推理引擎推出了专用网站。这一里程碑标志着该项目在实现让更多人能够使用高性能本地 AI 这一使命上迈出了重要一步。通过提供一个中心化枢纽,该项目旨在为在消费级硬件上使用大语言模型的开发者和研究人员精简文档、资源和社区参与。

huggingface

6 stories
01

Qwen-VLA:统一跨任务、环境和机器人实体的视觉-语言-动作建模

具身智能通常通过针对单个任务(如操作或导航)的专门模型进行研究,导致能力碎片化,且在跨任务、环境和机器人实体上的泛化能力有限。在这项工作中,我们研究了异构具身决策问题是否可以在单一视觉-语言-动作模型中统一。我们提出了 Qwen-VLA,这是一种统一的具身基础模型,通过基于 DiT 的动作解码器,将 Qwen 的视觉-语言建模栈从感知、理解和推理扩展到了连续动作和轨迹生成。

02

minWM:用于实时交互式视频世界模型的全栈开源框架

近期的视频扩散基础模型在高质量视频生成方面取得了显著进展,但将其转化为实时交互式视频世界模型仍然具有挑战性。交互式世界模型需要可控、因果且低延迟的推演,这在实践中需要涵盖数据构建、可控微调、自回归训练、少步蒸馏和流式推理的完整流水线。在这项工作中,我们提出了 minWM,这是一个用于构建实时交互式视频世界模型的全栈开源框架。

03

AdaState:用于流式视频生成的自进化锚点

自回归视频扩散模型通过顺序产生帧来生成流式视频,将每个片段调节在之前生成的内容上。这些模型在结构上被锚定在第一帧,这会引起不成比例的关注并抑制视频动态。为了解决这个问题,我们用一个自适应状态取代了静态锚点,这是一个模型在每个片段中与内容一起去噪但从不渲染的隐藏潜变量,从而改善了视频动态和运动。

04

Skill0.5:代理强化学习中用于分布外泛化的联合技能内化与利用

为大语言模型配备显式技能已成为使自主代理能够解决复杂任务的一种有前途的范式。我们提出了 Skill0.5,一种新颖的代理 RL 框架,它通过结合通用技能内化与任务特定的技能利用来明确区分技能处理方式,在性能上优于基于记忆和基于技能的 RL 基线。

05

AsyncTool:评估多任务场景下的异步函数调用能力

基于大语言模型(LLM)的代理在利用外部工具解决复杂任务方面展现出了强大的能力。然而,现有的评估往往忽略了工具使用的时序维度,尤其是工具响应延迟。我们提出了 AsyncTool,这是一个用于在具有延迟工具反馈的交互式多任务工具使用环境中评估基于 LLM 的代理的基准。

06

迈向可验证的多模态深度研究:用于交错式报告生成的多代理框架

我们提出了 Ptah,一个用于交错式报告生成的多代理框架,它编排了从用户查询到呈现 Web 报告的生命周期。它利用专用代理来构建视觉感知计划、收集基于声明的证据、在视觉工作记忆中维护源对齐的图像,并验证事实依据和跨模态的一致性。