NO/FOMO

Independent AI signal, once a day

The AI briefing worth opening.

ISSUE DATE2025-09-08DEFAULT EDITION
This issue
—
All time
—

Twitter

6 stories
01

googleaidevs_Veo 3和Veo 3 Fast在Gemini API中普遍可用

Google AI Developers宣布,其视频生成模型Veo 3和Veo 3 Fast现已在Gemini API中普遍可用。同时,这两款模型的定价降低了约50%,并新增支持9:16垂直和1080 HD输出格式,为开发者提供更经济、灵活的视频生成能力。

02

fchollet_生成式AI对未来数据与文化的影响

知名AI研究员弗朗索瓦·肖莱特(François Chollet)警告称,随着生成式AI内容泛滥,互联网将充斥大量低质量信息。他预测,未来的AI模型将不可避免地主要基于这些“劣质数据”进行训练,仅可验证的推理任务或能在模拟环境中完成。肖莱特认为,这种趋势将导致人类文化不断被低质量内容反复重塑,引发对AI数据质量和文化演变的深远担忧。

03

GoogleDeepMind_RoboBallet AI系统实现机器人协作编排

Google DeepMind与IntrinsicAI及UCL合作开发了名为RoboBallet的AI系统。该系统能够精确编排多达8个机械臂的协作,确保无碰撞运行,并自动化任务与运动规划。RoboBallet在性能上超越传统方法约25%,显著提升了机器人团队的协同作业效率和精度,展现了AI在复杂机器人控制领域的突破性进展。

04

Cognition_融资超4亿美元,估值102亿美元推进AI编程智能体

AI公司Cognition宣布成功完成超4亿美元融资,投后估值达102亿美元,旨在进一步推动AI编程智能体的前沿发展。本轮融资由Founders Fund领投,Lux、8VC、Neo等现有投资者继续加码,同时Bain Capital Ventures和D1 Capital等新投资者也加入其中。此轮融资将加速其在AI编码领域的创新。

05

MinqiJiang_LLM迭代自改进新方法ExIt

Minqi Jiang介绍了FAIR的最新研究ExIt,一种基于强化学习的自动课程方法,旨在高效训练LLM在推理时进行迭代自改进。ExIt通过“自发散”策略,利用模型自身响应生成多样化训练任务,仅需单步自改进任务即可实现多步自改进能力。该方法显著降低了训练成本,并在竞赛数学、多轮任务及Kaggle竞赛中展现出优于GRPO的性能,尤其在MLE-bench上提升22%。

06

UnslothAI_Grok 2.5本地运行优化与模型压缩

UnslothAI宣布其技术已实现xAI Grok 2.5大模型在本地设备上高效运行,仅需120GB RAM。这款2700亿参数的模型通过Unsloth的动态3比特GGUF技术,在128GB内存的Mac上可达约5 t/s的运行速度。该技术将原始539GB的模型压缩至118GB,体积缩小80%,同时保留关键层为8比特以维持性能。

GitHub

6 stories
01

Finally, LLM agents that actually follow instructions

Parlant是一个创新的AI智能体框架,旨在解决大型语言模型(LLM)智能体在实际应用中难以遵循指令、易产生幻觉和行为不一致的问题。它通过引入行为准则、会话旅程、工具集成、领域适应和可解释性等核心功能,确保智能体能够可靠地执行预设任务并保持一致的行为。该框架适用于金融服务、医疗保健、电子商务和法律科技等对合规性和精确性要求高的行业,帮助开发者构建生产级、可预测且易于扩展的AI智能体。

02

TARS

TARS是一个多模态AI智能体栈,包含Agent TARS和UI-TARS Desktop两大项目。Agent TARS是一个通用的多模态AI智能体,将GUI智能体和视觉能力引入终端、计算机、浏览器和产品,通过CLI和Web UI提供服务,旨在通过前沿多模态大模型和MCP工具集成实现更接近人类的任务完成。UI-TARS Desktop是基于UI-TARS模型构建的桌面应用,提供本地和远程计算机及浏览器操作能力,支持自然语言控制、屏幕截图、视觉识别、精确鼠标键盘控制,并具备跨平台、实时反馈和本地安全处理等特点,致力于提升用户计算机使用体验。

03

🚀 Kilo Code

Kilo Code是一个开源的VS Code AI智能体,旨在通过自然语言生成代码、自动化任务、自动重构代码。它集成了最新的AI模型如Gemini 2.5 Pro、Claude 4 Sonnet/Opus和GPT-5,并提供MCP服务器市场以扩展功能。该项目源自Roo Code和Cline,致力于提供无需API密钥的便捷AI编码体验,并支持多模式工作流,如架构规划、代码编写和调试,显著提升开发效率。

04

Jaaz.app

Jaaz.app是一款开源的多模态创意助手,旨在替代Canva等工具,并强调隐私保护和本地运行。它提供AI驱动的图像和视频生成功能,支持一键生成、无提示词创作(如魔法画布和魔法视频),以及无限画布和视觉故事板。该平台集成了智能AI代理系统,可与本地及云端模型协作,并支持灵活部署。其核心优势在于本地优先、开源无追踪的隐私安全特性,适用于商业用途,用户拥有数据所有权。

05

Generative AI for Beginners (Version 3) - A Course

该GitHub仓库提供了一个由微软云倡导者开发的21节课程,旨在教授如何构建生成式AI应用。课程内容涵盖大语言模型(LLMs)基础、提示工程、检索增强生成(RAG)、函数调用、开源模型、AI智能体及模型微调等核心技术。它通过Python和TypeScript提供代码示例,支持Azure OpenAI、GitHub Marketplace模型目录和OpenAI API,帮助开发者掌握文本生成、聊天、搜索和图像生成等应用开发。

06

XLeRobot 🤖

XLeRobot是一个开源、低成本的具身智能双臂移动机器人项目,旨在普及具身AI技术。该机器人起始成本仅约660美元,组装时间少于4小时,使其成为个人和研究机构的经济型选择。它基于LeRobot等多个知名项目构建,支持键盘、Xbox手柄、Switch Joycon等多种控制方式,并提供完善的仿真环境与实物部署指南,能够执行家庭任务,推动具身AI的普及与应用。

wechat

6 stories
01

ICCV`25 | 把DragDiffusion“卷”哭了:速度快600倍,效果更精准!港大开源Inpaint4Drag

香港大学最新开源的Inpaint4Drag框架,革新了基于拖拽的图像编辑技术。该方法将复杂的拖拽编辑任务解耦为双向扭曲和标准图像修复,通过像素空间双向扭曲算法和基于SAM的边界细化,实现了对图像内容的精准、连贯变形。Inpaint4Drag提供实时预览功能,显著提升了用户交互体验,并有效解决了传统方法中稀疏控制点带来的模糊性问题。实验结果表明,Inpaint4Drag在拖拽精度和图像一致性上表现卓越,处理速度比DragDiffusion快近600倍,同时保持了高质量的修复效果,为图像编辑领域带来了突破性进展。

02

牛津、新加坡国立等发布最新Agentic强化学习范式综述:从「会说」迈向「会做」,LLM迎来下半场!

文章指出,大语言模型(LLM)的训练正从传统的基于偏好的强化学习(PBRFT)向Agentic强化学习(Agentic RL)范式转变。Agentic RL旨在使LLM从被动对齐进化为主动决策的智能体,具备在动态环境中规划、行动和持续学习的能力。牛津大学、新加坡国立大学等机构联合发布了一篇长达百页的综述,系统梳理了Agentic RL的理论框架、演化脉络、六大核心能力(规划、工具使用、记忆、自我改进、推理、感知)及多领域应用。综述还探讨了可信性、扩展性和复杂环境等未来挑战,强调Agentic RL是LLM从“会说”迈向“会做”的关键,标志着LLM训练进入下半场。

03

全流程国产GPU,上下文提速100倍!中国科学院发布「线性复杂度」类脑大模型

中国科学院自动化研究所李国齐、徐波团队发布了国产自主可控类脑脉冲大模型SpikingBrain (瞬悉)-1.0。该模型借鉴大脑神经元机制,采用线性/近线性复杂度架构,有效解决了传统Transformer模型在长序列处理上的高开销问题。SpikingBrain-1.0在全流程国产GPU平台上完成训练和推理,以极低数据量实现与主流模型媲美的性能,并在超长上下文处理上实现高达100倍的提速。该研究探索了“内生复杂性”通用智能路径,旨在构建低功耗、高性能的类脑通用智能计算模型,为未来类脑芯片设计提供启发,并已开源部分模型以支持生态构建。

04

GPT-5爆改时尚圈,让Excel原地复活!OpenAI黑客松大奖出炉

OpenAI近期举办的GPT-5黑客松大赛揭示了其强大的应用潜力。韩国Gentoo团队凭借基于GPT-5的营销活动模拟系统夺冠,该系统能精准预测营销效果与退货率。其他入围项目涵盖AI时尚造型、Excel智能自动化、知识可视化教育视频生成、电脑操作自动化及电力电网智能调度。这些创新应用充分展现了GPT-5在多领域、多模态及复杂任务编排方面的突破性能力,预示着AI在商业、教育、能源等行业的深度融合与变革。

05

扎克伯格的豪赌初见成效?Meta新方法让LLM长上下文处理提速30倍

Meta Superintelligence Labs提出REFRAG高效解码框架,旨在解决大型语言模型(LLM)在处理长上下文输入时的效率瓶颈,尤其是在检索增强生成(RAG)应用中。该框架通过将文本压缩为块向量并选择性地保留关键信息,显著降低了注意力机制的计算开销和KV Cache内存消耗。实验结果显示,REFRAG可将首个token生成时间(TTFT)加速高达30.8倍,有效上下文扩展16倍,同时保持甚至提升模型准确率。这使得“大上下文RAG”从理论走向现实,为LLM处理海量信息提供了高效解决方案,尽管其最终价值仍待广泛实践检验。

06

全球图生视频榜单第一,爱诗科技PixVerse V5如何改变一亿用户的视频创作

爱诗科技的PixVerse V5模型在图生视频领域位列全球第一,文生视频位居第二,已服务超一亿用户。该产品以“创意”为核心,通过Agent创作助手等功能,极大降低了AI视频创作门槛。技术上,V5版本实现了智能理解、秒级生成和更逼真自然的效果,这得益于统一特征空间、扩散极致蒸馏和自研DiT架构等创新。爱诗科技凭借快速迭代和技术突破,正引领AI视频生成进入普惠应用新阶段,赋能普通用户实现创意表达。

huggingface

6 stories
01

语言模型为何会产生幻觉

像面对难题的学生一样,大型语言模型有时在不确定时会进行猜测,产生看似合理但实际上不正确的陈述,而非承认不确定性。这种“幻觉”即使在最先进的系统中也持续存在,并损害了信任。我们认为语言模型产生幻觉是因为训练和评估程序奖励猜测而非承认不确定性,并且我们分析了现代训练流程中幻觉的统计学原因。幻觉并非神秘——它们简单地源于二元分类中的错误。如果无法区分不正确的陈述和事实,那么预训练语言模型中的幻觉就会通过自然的统计压力产生。我们进一步指出,幻觉之所以持续存在,是因为大多数评估的评分方式——语言模型被优化为优秀的应试者,而不确定时的猜测可以提高测试表现。这种惩罚不确定性回应的“流行病”只能通过社会技术缓解措施来解决:修改现有基准的评分方式,这些基准虽然存在偏差但主导着排行榜,而不是引入额外的幻觉评估。这一改变可能引导该领域走向更值得信赖的AI系统。

02

基于大型语言模型的符号图形编程

大型语言模型(LLMs)在程序合成方面表现出色,但其生成能够渲染出精确视觉内容的符号图形程序(SGPs)的能力仍未得到充分探索。我们研究了符号图形编程,其目标是从自然语言描述生成SGP。这项任务也通过促使LLMs生成由SGP渲染的图像,作为理解LLMs如何理解视觉世界的一个视角。在各种SGP中,本文专注于可伸缩矢量图形(SVGs)。我们首先考察LLMs生成SGP的程度。为此,我们引入了SGP-GenBench,一个涵盖对象保真度、场景保真度和组合性(属性绑定、空间关系、数值性)的综合基准。在SGP-GenBench上,我们发现前沿专有模型显著优于开源模型,并且性能与通用编码能力密切相关。受此差距的启发,我们旨在提高LLMs生成SGP的能力。我们提出了一种带有可验证奖励的强化学习(RL)方法,其中格式有效性门确保可渲染的SVG,而跨模态奖励通过强大的视觉编码器(例如,用于文本-图像的SigLIP和用于图像-图像的DINO)将文本与渲染图像对齐。将我们的方法应用于Qwen-2.5-7B,它显著提高了SVG生成质量和语义,达到了与前沿系统相当的性能。我们进一步分析了训练动态,表明RL诱导了(i)将对象更精细地分解为可控原语,以及(ii)改善场景连贯性的上下文细节。我们的结果表明,符号图形编程为跨模态基础提供了一个精确且可解释的视角。

03

LuxDiT: 基于视频扩散Transformer的光照估计

从单一图像或视频中估计场景光照一直是计算机视觉和图形学领域的一个长期挑战。基于学习的方法受到真实HDR环境图稀缺性的限制,这些环境图的捕获成本高昂且多样性有限。尽管最近的生成模型为图像合成提供了强大的先验知识,但光照估计仍然困难,因为它依赖于间接视觉线索、需要推断全局(非局部)上下文以及恢复高动态范围输出。我们提出了LuxDiT,这是一种新颖的数据驱动方法,它微调了一个视频扩散Transformer,以根据视觉输入生成HDR环境图。我们的模型在一个包含多样化光照条件的大型合成数据集上进行训练,学习从间接视觉线索推断光照,并有效地泛化到真实世界场景。为了改善输入与预测环境图之间的语义对齐,我们引入了一种低秩适应微调策略,该策略使用了收集到的HDR全景图数据集。我们的方法能够生成准确的光照预测,并具有逼真的角度高频细节,在定量和定性评估中均优于现有的最先进技术。

04

LatticeWorld:一个由多模态大语言模型驱动的交互式复杂世界生成框架

近期研究日益关注开发模拟复杂现实世界场景的3D世界模型。世界模型已在具身AI、自动驾驶、娱乐等多个领域获得广泛应用。更真实的、具有精确物理特性的模拟将有效缩小“模拟到现实”的差距,并使我们能够便捷地收集关于现实世界的丰富信息。虽然传统手动建模已能创建虚拟3D场景,但现代方法已利用先进的机器学习算法进行3D世界生成,其中最新进展主要集中于基于用户指令创建虚拟世界的生成方法。本工作通过提出LatticeWorld,探索了这一研究方向,LatticeWorld是一个简单而有效的3D世界生成框架,它简化了3D环境的工业生产流程。LatticeWorld利用轻量级大语言模型(LLaMA-2-7B)结合工业级渲染引擎(例如虚幻引擎5)来生成动态环境。我们提出的框架接受文本描述和视觉指令作为多模态输入,并创建具有动态智能体的大规模3D交互世界,其特点是具有竞争性的多智能体交互、高保真物理模拟和实时渲染。我们进行了全面的实验来评估LatticeWorld,结果表明它在场景布局生成和视觉保真度方面取得了卓越的准确性。此外,与传统手动生产方法相比,LatticeWorld在保持高创造性质量的同时,将工业生产效率提高了90倍以上。我们的演示视频可在https://youtu.be/8VWZXpERR18观看。

05

U-ARM:用于机器人操作的超低成本通用遥操作界面

我们提出了U-Arm,一个低成本且快速适应的从动遥操作框架,旨在与大多数市售机械臂进行接口。我们的系统通过三个结构独特但共享一致控制逻辑的3D打印主控臂支持遥操作,从而实现与各种商业机器人配置的无缝兼容性。与之前的开源从动遥操作界面相比,我们进一步优化了机械设计和伺服电机选择,使得6自由度主控臂的物料清单(BOM)成本仅为50.5美元,7自由度版本为56.8美元。为了提高可用性,我们通过机械和控制优化,缓解了控制冗余自由度这一常见挑战。实验结果表明,与另一低成本遥操作界面Joycon相比,U-Arm在多个操作场景中实现了39%更高的数据收集效率和相当的任务成功率。我们已经开源了三种配置的所有CAD模型,并提供了仿真支持以验证遥操作工作流程。我们还开源了使用U-Arm收集的真实世界操作数据。项目网站是https://github.com/MINT-SJTU/LeRobot-Anything-U-Arm。

06

自举任务空间以实现自我改进

许多任务领域中的进展源于对先前解决方案尝试的重复修订。在推理时训练智能体能够在这种序列上可靠地自我改进,是强化学习(RL)的一个自然目标,然而,朴素的方法假设一个固定的最大迭代深度,这既昂贵又随意。我们提出了探索性迭代(ExIt),这是一系列自课程强化学习方法,它直接利用自我改进任务的循环结构,训练大型语言模型(LLMs)在推理时执行多步自我改进,同时仅在信息量最大的单步迭代上进行训练。ExIt通过选择性地采样在一次情节中遇到的最具信息量的中间、部分历史,以进行持续迭代,从而扩展任务空间,并将这些起始点视为新的自我迭代任务实例,以训练自我改进策略。ExIt还可以与明确的探索机制结合,以维持更大的任务多样性。在包括竞赛数学、多轮工具使用和机器学习工程在内的多个领域中,我们证明了ExIt策略,无论是从单个还是多个任务实例开始,都能在未见过的任务实例上产生表现出强大推理时自我改进能力的策略,并且能够在超出训练期间遇到的平均迭代深度的步数预算内迭代以实现更高性能。