NO/FOMO

Independent AI signal, once a day

The AI briefing worth opening.

ISSUE DATE2025-09-02DEFAULT EDITION
This issue
—
All time
—

Twitter

6 stories
01

emilygsands_Mistral AI与Stripe合作Le Chat集成MCP处理支付数据

Emily Glassberg Sands宣布,Mistral AI的Le Chat现已通过与Stripe的MCP集成,能够处理支付数据、退款、发票和订阅等财务操作。此次合作显著增强了Le Chat作为企业级AI助手的连接性和实用性,使其成为更全面的AI解决方案,支持20多个连接器并具备可控内存功能。

02

corbtt_发布RL训练深度研究智能体食谱,30小时H200超越Sonnet-4

Kyle Corbitt宣布发布一项利用强化学习(RL)训练前沿深度研究智能体的“食谱”。该方法仅需在H200 GPU上运行30小时,任何开发者便能使用开源工具在DeepResearch Bench基准测试中超越Sonnet-4的性能。这标志着在低成本计算资源下实现高性能AI智能体训练的重大突破,有望加速AI研究与应用普及。

03

eliebakouch_英伟达13B模型4比特训练稳定性验证

推文指出,英伟达正对其130亿参数模型进行大规模消融研究,训练数据量高达10万亿个token,旨在验证其4比特(NVFP4)训练技术的稳定性。此举或预示英伟达在低精度模型训练方面取得重要进展,有望降低大模型训练成本并提升效率。

04

gm8xx8_Nous Research发布Hermes 4开源推理系列大模型

Nous Research发布了Hermes 4开源推理系列大模型,包括基于Llama-3.1的70B和405B版本,以及基于Qwen3的14B基线模型。该系列模型在训练、数据处理、推理模式和评估方面进行了多项创新,尤其引入了混合推理模式和RefusalBench评估基准。Hermes 4在数学、推理、代码和知识等多个领域表现出色,其70B版本在RefusalBench推理模式下得分远超GPT-5。

05

LangChainAI_LangChain与LangGraph 1.0alpha发布

LangChainAI宣布LangChain与LangGraph的1.0alpha版本已在Python和JS中发布。LangGraph作为低级智能体编排框架,提供持久执行和精细控制;LangChain则专注于通过标准化模型抽象和预构建智能体模式加速AI功能开发。此次更新预示着LangChain 1.0将成为基于LangGraph的新核心智能体抽象包。官方1.0版本预计10月下旬发布,并征集用户反馈。

06

DITOGAMESch_多模态AI工具链测试:Gemini、Kling与Veo协同创作

推文作者Travis Davids分享了其测试多模态AI工具链的创意工作流。该流程结合了Gemini 2.5 Flash进行图像生成(包括“Nano Banana”模型和拼贴法),并利用Kling 2.1处理视频的起始和结束帧,同时强调Veo 3是其偏爱的组合。此测试旨在探索不同AI工具间的协同创作潜力。

GitHub

5 stories
01

Fast and Flexible Multi-Agent Automation Framework

CrewAI是一个轻量、快速的Python框架,专为自主AI智能体编排设计,独立于LangChain等现有框架。它提供Crews(多智能体协作)和Flows(事件驱动工作流)两种核心机制,兼顾高层简洁性与底层精细控制。CrewAI致力于将复杂业务流程转化为高效智能自动化,尤其适用于企业级应用,并拥有超过10万认证开发者的活跃社区支持。

02

Koog

Koog是一个基于Kotlin的AI代理框架,旨在以纯Kotlin方式构建和运行智能代理。它提供了一系列核心功能,包括与模型上下文协议(MCP)集成、嵌入能力、自定义工具创建、智能历史压缩、强大的流式API以及持久化代理内存。该框架支持JVM、JS、WasmJS和iOS等多平台部署,并兼容Google、OpenAI等主流LLM提供商,赋能开发者构建可处理复杂工作流并与用户交互的智能代理应用,是AI工程领域的理想选择。

03

Bytebot: Open-Source AI Desktop Agent

Bytebot是一个开源AI桌面智能体,赋予AI完整的虚拟桌面环境,使其能像人类一样操作电脑完成复杂任务。它支持使用任意应用程序、管理文件、登录网站、处理文档和执行跨程序工作流。核心功能包括任务自主性、文档处理和真实应用交互。Bytebot由虚拟桌面、AI代理、任务界面和API组成,支持多种AI模型,提供数据隐私和高度定制化能力,适用于业务流程自动化、开发测试和研究分析等场景。

04

🌟 500+ AI Agent Projects / UseCases

该GitHub仓库汇集了500多个跨行业AI智能体项目和用例,旨在展示AI智能体在医疗、金融、教育、客户服务等领域的实际应用。它提供了详细的用例描述,并链接到相应的开源项目,涵盖CrewAI、AutoGen、Agno、Langgraph等主流AI框架。该资源库是开发者、研究人员和商业爱好者探索AI智能体灵感和学习的宝库,促进了AI代理技术的普及和创新。

05

Chatterbox TTS

Chatterbox是Resemble AI推出的首个生产级开源文本转语音(TTS)模型,采用MIT许可。该模型在与ElevenLabs等领先闭源系统的对比评估中表现出色,并首次支持情感夸张控制功能,能为语音注入独特表现力。Chatterbox基于0.5B Llama骨干网络,经过50万小时数据训练,具备SoTA零样本TTS能力、超稳定推理及内置PerTh水印技术,适用于模因、视频、游戏和AI智能体等多种应用场景。

wechat

6 stories
01

ICCV 2025 | 描述替代指令:南大联合vivo发布DescriptiveEdit,定义语义图像编辑新范式

南京大学与vivo联合发布了DescriptiveEdit,提出一种基于“描述”的语义图像编辑新范式。该方法通过描述直接引导编辑意图,实现了高质量的全局与局部图像编辑,并在指令遵循度与结构保真之间取得更理想平衡。DescriptiveEdit引入Attention Bridge进行高效参考图控制,并采用零初始化线性层自适应融合特征,有效解决了精准编辑与结构保真的冲突。此外,它能无缝兼容ControlNet、LoRA等现有文生图生态扩展,展现出卓越的兼容性和编辑性能。实验证明,DescriptiveEdit在图像一致性和指令遵循度方面均优于现有方案,为语义图像编辑领域带来了可扩展、即插即用的灵活解决方案。

02

马斯克发布《宏伟蓝图4》:特斯拉80%价值在于机器人,还意外露出了一款新车

特斯拉最新发布的《宏伟蓝图4》揭示了公司未来战略重心:埃隆·马斯克指出,特斯拉约80%的价值将来自其人形机器人Optimus。该蓝图标志着特斯拉从电动汽车和可持续能源向人工智能与物理世界深度融合的范式转变,旨在通过大规模统一软硬件实现“可持续富足”。《蓝图4》强调了增长无限、创新破限、技术解决现实问题、自动化普惠全人类及普及促进增长等五大原则,并将汽车视为特定场景下的轮式机器人,预示着FSD技术将通用化应用于人形机器人。文章还提及了疑似新款Cybertruck SUV的意外曝光。

03

用短视频成本生成长视频,字节Seed新注意力机制让计算量降低85%

字节跳动Seed团队与斯坦福等机构合作,推出名为Mixture of Contexts (MoC) 的新型稀疏注意力机制,旨在以短视频的成本生成高质量长视频。该机制将长视频生成重定义为上下文检索任务,通过高效的长期记忆检索,显著降低了计算量。实验表明,MoC能将长视频生成所需的计算量削减高达85%,同时保持人物和场景的连贯性及视频质量,解决了传统方法中跨时域记忆调取效率低的问题,为长视频内容创作提供了高效且经济的解决方案。

04

腾讯开源智能体新框架:不用训练无需充值,用开源模型实现SOTA Agent

腾讯优图实验室正式开源Youtu-agent智能体框架,旨在解决当前智能体开发中上手门槛高、依赖复杂环境及成本高昂等问题。该框架完全基于开源生态,无需训练模型或依赖闭源API,却能在多个挑战性基准上取得领先性能,接近甚至超越部分付费解决方案。Youtu-agent具备开源友好、灵活架构、自动化智能体生成及简洁高效等核心亮点,并已在文件管理、数据分析、学术研究和广域综述等真实场景中展现实用性。其DITA原则和自动化Agent生成机制大幅降低了智能体定制难度,为科研人员、应用开发者及AI爱好者提供了强大的开源基线和即用型工具。

05

你的RAG系统有个数学BUG,DeepMind首次证明嵌入向量检索召回能力有限

谷歌DeepMind最新研究首次从数学层面揭示了当前主流单向量嵌入检索模型的固有局限性。论文指出,性能瓶颈并非训练不足,而是将复杂相关性信息压缩至固定维度向量的模式本身。研究通过“符号秩”概念证明,固定维度的向量空间无法表示任意复杂的查询-文档组合关系,导致模型在面对高复杂度检索任务时存在数学上的“天花板”。实验验证(如“自由嵌入”和LIMIT数据集)表明,即使是SOTA单向量模型也无法完美处理看似简单但组合关系复杂的任务,而稀疏检索(BM25)和多向量模型表现更优。这预示着RAG系统若依赖单一向量嵌入,其召回能力将受限,促使业界重新思考混合检索和多向量架构的未来方向,以构建更鲁棒的AI系统。

06

AI读网页,这次真不一样了,谷歌Gemini解锁「详解网页」新技能

文章介绍了谷歌Gemini API新推出的URL Context功能,该功能允许Gemini模型深度访问和处理URL内容,包括网页、PDF和图像,上限达34MB。与传统AI处理链接仅读取摘要不同,URL Context作为专为开发者设计的API,能进行完整的文档解析,理解结构、内容和数据,支持深度解析PDF、多模态理解图片及多种网页文件。作者Thomas Reid认为其是RAG的“棺材钉”,因为它简化了公开网络内容处理流程,无需复杂的RAG步骤。尽管有容量和访问限制,URL Context揭示了基础模型将外部能力内置化的行业趋势,为开发者提供了更高效、精准的解决方案,但RAG在私有文档处理等场景仍不可或缺。

huggingface

6 stories
01

PVPO:面向智能体推理的预估价值策略优化

无Critic的强化学习方法,特别是群组策略,因其在复杂任务中的高效性而备受关注。然而,这些方法严重依赖策略内部的多次采样和比较来估计优势,这可能导致策略陷入局部最优并增加计算成本。为解决这些问题,我们提出了PVPO,一种通过优势参考锚点和数据预采样增强的高效强化学习方法。具体而言,我们利用参考模型提前进行rollout,并使用计算出的奖励分数作为参考锚点。我们的方法有效纠正了组内比较引入的累积偏差,并显著减少了对rollout次数的依赖。同时,参考模型可以在数据预采样期间评估样本难度,从而有效选择高收益数据以提高训练效率。在两个领域的九个数据集上进行的实验表明,PVPO实现了最先进(SOTA)的性能。我们的方法不仅在多任务中展现出强大的泛化能力,而且在不同规模的模型上也表现出可扩展的性能。

02

T2R-bench:一个从真实世界工业表格生成文章级报告的基准

针对大型语言模型(LLMs)在表格推理方面的能力,已开展了广泛研究。然而,将表格信息转化为报告这一核心任务对于工业应用而言仍是一个重大挑战。此任务面临两个关键问题:1)表格的复杂性和多样性导致推理结果不尽理想;2)现有表格基准缺乏充分评估此任务实际应用的能力。为弥补这一空白,我们提出了表格到报告(table-to-report)任务,并构建了一个名为T2R-bench的双语基准,该基准的关键信息流是从表格到报告。该基准包含457个工业表格,均来源于真实世界场景,涵盖19个工业领域和4种工业表格类型。此外,我们提出了一套评估标准,以公平衡量报告生成的质量。对25个广泛使用的LLMs进行的实验表明,即使是Deepseek-R1等最先进的模型也仅取得了62.71的综合得分,这表明LLMs在T2R-bench上仍有改进空间。源代码和数据将在接收后提供。

03

在复杂动态环境中,输入重构如何提高工具使用准确性?一项基于τ-bench的研究

大型语言模型(LLMs)在推理和规划能力方面的最新进展,使其在动态环境中作为能够使用工具的自主智能体展现出潜力。然而,在像tau-bench这样的多轮对话环境中,这些智能体在一致性推理、遵守领域特定策略以及在长时间的工具调用和对话中提取正确信息方面常常面临困难。为了捕捉并缓解这些失败,我们对对话轨迹中常见的错误进行了全面的手动分析。随后,我们通过对工具调用智能体的输入进行重构来实验性地改进智能体的决策。最后,我们提出了输入重构多智能体(IRMA)框架,该框架自动重构用户查询,并辅以相关的领域规则和工具建议,以供工具调用智能体关注。结果表明,IRMA在整体pass^5分数上显著优于ReAct、Function Calling和Self-Reflection,分别高出16.1%、12.7%和19.1%。这些发现强调了IRMA在动态环境中相比其他方法的卓越可靠性和一致性。

04

ALLaM 34B 的 UI 级评估:通过 HUMAIN Chat 衡量以阿拉伯语为中心的 LLM

主要在英文语料库上训练的大型语言模型(LLM)通常难以捕捉阿拉伯语的语言和文化细微差别。为弥补这一空白,沙特数据与人工智能管理局(SDAIA)推出了专注于阿拉伯语的 ALLaM 系列模型。其中向公众开放的最强大的模型 ALLaM-34B 随后被 HUMAIN 采用,HUMAIN 基于该模型开发并部署了 HUMAIN Chat,一个封闭的对话式网络服务。本文对 ALLaM-34B 进行了扩展和改进的 UI 级评估。我们使用了一个涵盖现代标准阿拉伯语、五种区域方言、语码转换、事实知识、算术和时间推理、创意生成以及对抗性安全性的提示包,收集了 115 个输出(23 个提示乘以 5 次运行),并使用三个前沿 LLM 评判器(GPT-5、Gemini 2.5 Pro、Claude Sonnet-4)对每个输出进行评分。我们计算了类别级别的平均值和 95% 置信区间,分析了分数分布,并可视化了方言度量热图。更新后的分析显示,在生成和语码转换任务上表现持续出色(均值均为 4.92/5),在现代标准阿拉伯语处理方面表现强劲(4.74/5),推理能力扎实(4.64/5),方言保真度有所提高(4.21/5)。安全相关提示显示出稳定可靠的性能(4.54/5)。总而言之,这些结果表明 ALLaM-34B 是一款强大且具有文化基础的阿拉伯语 LLM,展示了其技术实力和实际部署的准备就绪性。

05

从反应式到认知式:具身智能体的类脑空间智能

空间认知通过构建内部空间模型来实现适应性的目标导向行为。强大的生物系统将空间知识整合为三种相互关联的形式:用于显著线索的地标、用于运动轨迹的路径知识以及用于地图式表示的概览知识。尽管多模态大语言模型(MLLMs)的最新进展已使具身智能体具备视觉-语言推理能力,但这些努力缺乏结构化的空间记忆,而是以反应式方式运作,限制了它们在复杂现实世界环境中的泛化能力和适应性。本文提出了用于导航的类脑空间认知(BSC-Nav),这是一个在具身智能体中构建和利用结构化空间记忆的统一框架。BSC-Nav 从以自我为中心的轨迹和上下文线索中构建异我中心认知地图,并动态检索与语义目标对齐的空间知识。BSC-Nav 与强大的MLLMs集成后,在各种导航任务中实现了最先进的效率和效能,展示了强大的零样本泛化能力,并支持在真实物理世界中实现多功能具身行为,为通用空间智能提供了一条可扩展且具有生物学基础的路径。

06

硅基民主:人工智能治理政体中的制度设计与对齐

本文介绍了“硅基民主”,这是一种基于智能体的模拟,其中,具备复杂心理特征的高级人工智能智能体社会在不同的制度框架下进行自我治理。我们通过让大型语言模型(LLMs)扮演具有创伤记忆、隐藏议程和心理触发点的智能体,来探索在人工智能时代作为人类的意义。这些智能体在预算危机和资源稀缺等各种压力下参与审议、立法和选举。我们提出了一种新颖的度量指标——权力保留指数(PPI),用于量化智能体将自身权力置于公共福祉之上的未对齐行为。我们的研究结果表明,制度设计,特别是宪法级人工智能(CAI)章程和调解式审议协议的结合,是一种有效的对齐机制。与限制较少的民主模式相比,这些结构显著减少了腐败的权力寻租行为,提高了政策稳定性,并增进了公民福祉。该模拟揭示,制度设计可能为对齐未来人工智能智能体社会中复杂、涌现的行为提供一个框架,促使我们重新思考在与非人类实体共享创造的时代中,哪些人类仪式和责任是至关重要的。