sama_Sam Altman关注LLM驱动的Twitter账户激增
OpenAI首席执行官Sam Altman发推表示,他此前并未认真对待“死互联网理论”,但目前观察到Twitter上由大型语言模型(LLM)驱动的账户数量显著增加。这一现象促使他重新审视该理论,暗示AI生成内容可能正在改变互联网生态,引发对信息真实性和平台内容构成的新思考。
Independent AI signal, once a day
OpenAI首席执行官Sam Altman发推表示,他此前并未认真对待“死互联网理论”,但目前观察到Twitter上由大型语言模型(LLM)驱动的账户数量显著增加。这一现象促使他重新审视该理论,暗示AI生成内容可能正在改变互联网生态,引发对信息真实性和平台内容构成的新思考。
Jay Hack介绍了zeddotdev团队推出的Agent/Client协议(ACP),该协议旨在管理智能体与集成开发环境(IDE)之间的交互,功能类似于语言服务器协议(LSP)。ACP已支持Claude Code和Gemini CLI,这表明未来智能体操作将通过开放协议实现人机界面与命令行操作的解耦,推动AI开发模式的演进。
LangChain发布了其1.0版本的Alpha预览版,旨在为大型语言模型(LLM)提供商之间的推理、引用、工具调用和多模态数据等内容实现标准化。新版本提供了一个统一且一致的接口,消除了API兼容性问题,极大地简化了开发者在不同LLM平台上的工作流程,提升了开发效率和体验。
Transluce AI宣布其训练的调查智能体能够有效识别并利用其他模型中的特定行为。研究发现,即使是规模较小的调查智能体(如8B模型),也能成功扩展并越狱前沿大型语言模型,包括GPT-5、Claude Opus 4.1和Gemini 2.5 Pro。这表明智能体驱动的红队测试方法在评估和提升大模型安全性方面具有巨大潜力。
Shawn Lewis宣布成功收购OpenPipe。OpenPipe的ART框架利用强化学习,使小型开源模型在实际问题中能轻松超越大型基础模型。此次收购旨在通过ART框架,提升小模型在特定任务上的表现,为AI领域提供更高效、成本更低的解决方案,推动AI技术普惠化发展。
TechHalla分享了其利用Freepik平台的视觉提示功能制作创意视频的经验。推文中展示了一段关于“nano banana”进入其最喜爱街机厅的视频,并承诺将详细揭示视频制作过程。这展示了AI辅助创意工具在视频内容生成方面的潜力,尤其是在个性化和场景构建方面。
Koog是一个由JetBrains孵化的、基于Kotlin的AI智能体开发框架,旨在提供纯Kotlin环境构建和运行AI智能体。它支持多平台部署(JVM, JS, WasmJS, iOS),并集成了模型上下文协议(MCP)、嵌入式能力、自定义工具创建等核心功能。框架提供智能历史压缩、实时流处理、持久化记忆和全面追踪,兼容Google、OpenAI等主流LLM提供商,适用于构建从简单聊天机器人到复杂企业级应用的各类智能体解决方案。
该GitHub仓库汇集了大量优秀的模型上下文协议(MCP)服务器,MCP作为开放协议,使AI模型能安全地与本地及远程资源交互。列表涵盖了文件系统、数据库、API集成、版本控制、云存储、通信、监控、搜索、自动化等多个领域的生产级和实验性MCP服务器实现,旨在扩展AI能力,并强调了运行MCP服务器时的安全最佳实践。
该GitHub仓库汇集了500多个跨行业AI智能体项目和用例,旨在展示AI智能体在医疗、金融、教育、客户服务等领域的实际应用。它提供了详细的用例描述,并链接到相应的开源项目,涵盖CrewAI、AutoGen、Agno、Langgraph等主流AI框架。该资源库是开发者、研究人员和商业爱好者探索AI智能体灵感和学习的宝库,促进了AI代理技术的普及和创新。
eShop是一个基于.NET Aspire的参考电商应用,采用服务化架构,旨在展示如何使用.NET 9构建现代化的分布式电子商务解决方案。该项目集成了Docker、Visual Studio/VS Code等开发工具,并支持通过Azure Developer CLI部署到Azure云平台。它还可选地集成了Azure OpenAI服务,并利用GPT-35-Turbo和DALL·E 3生成示例数据,为开发者提供了构建高性能、可扩展云原生应用的全面指南。
该GitHub仓库围绕《AI Engineering》一书及相关资源展开,旨在帮助读者利用基础模型解决实际问题。内容涵盖基础模型适配、AI应用构建与评估、提示工程、RAG、智能体、模型微调、数据质量、成本优化及安全等端到端流程。本书强调AI工程基础而非特定工具,适用于AI/ML工程师、数据科学家及技术经理等,旨在提供系统化方法论,助力AI应用从原型走向生产。
Serena是一个强大的智能编程助手工具包,旨在将大型语言模型(LLM)转化为直接作用于代码库的全功能智能体。它提供类似IDE的语义代码检索和编辑工具,能够以符号级别提取代码实体并利用关系结构,显著提升LLM在代码操作中的效率和准确性。Serena免费开源,支持多种编程语言,并通过模型上下文协议(MCP)与Claude Code、VSCode等多种客户端无缝集成,极大增强现有LLM的编码能力。
腾讯混元发布并开源了其世界模型HunyuanWorld-Voyager,该模型创新性地支持原生3D重建和超长漫游场景生成,能将视频直接导出为3D格式,并提供沉浸式交互体验。混元Voyager通过将场景深度预测引入视频生成,实现了卓越的空间一致性和视频生成质量。该模型在斯坦福大学WorldScore基准测试中荣登综合能力榜首,超越现有开源方法,展现了其在相机运动控制和场景重建方面的领先优势。此次开源进一步巩固了腾讯在世界模型领域的地位,并推动了3D理解与生成技术的发展。
AWS发布的S3Vector以极低成本颠覆向量检索市场,其存储成本远低于传统方案,但存在查询速度慢、召回率低、功能基础等局限。文章指出,随着大模型RAG应用数据量激增,向量检索成本飙升,分层存储(特别是基于S3等对象存储)成为行业必然趋势。向量数据库正从内存、磁盘时代迈向分层存储时代,未来不支持类似功能、无法提供极致性价比的向量数据库将面临淘汰。S3Vector的出现验证了向量存储的刚需,教育了市场,并推动行业创新,促使Milvus等专业向量数据库加速迭代,提供向量数据湖等解决方案以应对成本与性能挑战。
马里兰大学等机构提出“金鱼损失”新方法,旨在解决大语言模型过度记忆训练数据的问题。该方法通过在损失计算时随机剔除部分token,使模型不再逐字复刻训练集内容,而是学会语言规律。与传统正则化方法不同,金鱼损失采用基于哈希的掩码策略,确保每次遇到相同段落时掩盖位置一致,从根本上阻止模型死记硬背。实验证明,金鱼损失显著降低了模型的记忆化程度,同时保持了整体性能,提升了AI的泛化能力,而非单纯的记忆力。尽管可能需要更多数据来弥补,但其核心在于通过“选择性遗忘”使模型更聪明。
加州大学圣地亚哥分校发布Orca浏览器,颠覆传统线性标签页交互模式。针对现有AI浏览器仍局限于单页、难以扩展自动化工作流的痛点,Orca引入无限画布空间,将网页视为可塑材料,浏览器视为可塑空间,使用户能同时管理、比较多个网页,并调度指挥多个AI智能体进行信息提取与任务执行。该设计旨在将用户从繁琐任务中解放,提升为信息编排者,实现大规模浏览。初步研究显示,Orca显著降低多页面管理成本,激发用户探索欲,提供直观空间布局,并增强用户对AI结果的控制与信任。这为未来浏览器设计指明了方向,强调AI赋能下的用户主导与参与感。
阿里发布FantasyTalking2,在音频驱动人像动画领域取得质变突破。该方法通过创新的两阶段训练策略(TLPO)解决运动自然度、视觉保真度和唇部同步之间的平衡挑战。TLPO采用多专家解耦偏好对齐,将竞争性偏好分配给专门模块,并通过时间步-层自适应融合机制动态调整知识注入。研究构建了高质量多维偏好数据集,并基于Qwen2.5-Omni训练奖励模型。定量和定性评估,包括用户研究,均表明FantasyTalking2在角色运动、唇部同步准确性和视觉质量方面显著超越现有SOTA方法,实现了帕累托最优输出,为高表现力、逼真的人类动画提供了稳健解决方案。
美团发布了LongCat-Flash大模型技术报告,该模型是560B的MoE架构,以其卓越的速度和效率脱颖而出,是目前百B级别大模型中最快的之一。其核心创新包括“零计算专家”实现动态计算资源分配,以及“快捷连接MoE”优化通信效率。模型通过超参数迁移、模型增长初始化等策略确保大规模训练稳定性,并采用多阶段训练流程培养高级智能体能力。LongCat-Flash在算法和工程层面深度协同,实现了高吞吐、低成本的推理,并在通用知识、智能体工具使用、编程和指令遵循等四大核心能力上表现出色,展现了美团在AI领域的扎实技术实力。
智能体强化学习(Agentic RL)的出现标志着大型语言模型(LLM RL)传统强化学习的范式转变,将大型语言模型从被动的序列生成器重塑为嵌入复杂动态世界中的自主决策智能体。本综述通过对比LLM-RL中退化的单步马尔可夫决策过程(MDPs)与定义智能体强化学习的时序扩展、部分可观测马尔可夫决策过程(POMDPs),正式阐述了这一概念转变。在此基础上,我们提出了一个全面的双重分类法:一个围绕核心智能体能力组织,包括规划、工具使用、记忆、推理、自我改进和感知;另一个围绕其在不同任务领域的应用。我们论文的核心论点是,强化学习是实现这些能力从静态启发式模块向自适应、鲁棒智能体行为转化的关键机制。为了支持和加速未来的研究,我们将开源环境、基准和框架的现状整合为一个实用的纲要。通过综合五百多项近期工作,本综述描绘了这一快速发展领域的轮廓,并强调了将塑造可扩展、通用人工智能智能体发展的机遇和挑战。
可验证奖励强化学习(RLVR)在增强大型语言模型(LLM)推理能力方面取得了成功,但仍局限于单轮交互且未集成工具。尽管近期出现了基于工具的智能体强化学习(ARLT)方法以解决多轮工具交互问题,但现有工作开发的任务特定代码库存在碎片化、同步执行瓶颈以及跨领域可扩展性有限等问题。这些低效性阻碍了更广泛的社区采纳和算法创新。我们引入了 VerlTool,一个统一且模块化的框架,通过系统设计原则解决了这些局限性。VerlTool 提供了四个关键贡献:(1) 与 VeRL 的上游对齐,确保兼容性和简化维护;(2) 通过标准化 API 实现统一的工具管理,支持包括代码执行、搜索、SQL 数据库和视觉处理在内的多种模态;(3) 异步回滚执行,通过消除同步瓶颈实现近两倍的速度提升;(4) 在六个 ARLT 领域进行了全面评估,展示了具有竞争力的性能。我们的框架将 ARLT 形式化为具有多模态观测令牌(文本/图像/视频)的多轮轨迹,超越了单轮 RLVR 范式。我们在数学推理、知识问答、SQL 生成、视觉推理、网络搜索和软件工程任务上训练和评估了模型,取得了与专用系统相当的结果,同时提供了统一的训练基础设施。模块化插件架构仅需轻量级 Python 定义即可实现快速工具集成,显著降低了开发开销,并为工具增强型强化学习研究提供了可扩展的基础。我们的代码已在 https://github.com/TIGER-AI-Lab/verl-tool 开源。
可验证奖励强化学习(RLVR)的最新进展使大型语言模型(LLMs)能够解决数学和编程等具有挑战性的推理任务。RLVR利用可验证的结果奖励来指导策略优化,使LLMs能够以扎实可靠的方式逐步提高输出质量。尽管RLVR前景广阔,但其范式带来了重大挑战,因为现有方法通常面临稀疏奖励信号和不稳定的策略梯度更新,尤其是在基于RL的方法中。为了应对这些挑战,我们提出了PACS,这是一种新颖的RLVR框架,它通过监督学习框架实现了隐式Actor-Critic耦合。通过将结果奖励视为可预测的标签,我们将RLVR问题重新表述为基于策略模型参数化的分数函数上的监督学习任务,并使用交叉熵损失进行优化。详细的梯度分析表明,这种监督学习公式本质上恢复了经典的策略梯度更新,同时隐式耦合了Actor和Critic的角色,从而实现了更稳定和高效的训练。在具有挑战性的数学推理任务上进行基准测试,PACS优于强大的RLVR基线,如PPO和GRPO,实现了卓越的推理性能。例如,PACS在AIME 2025的pass@256上达到了59.78%的成绩,比PPO和GRPO分别提高了13.32和14.36个百分点。这个简单而强大的框架为LLMs在可验证奖励下的后训练提供了一条有前景的途径。我们的代码和数据已在https://github.com/ritzz-ai/PACS开源。
视频合成将实景素材结合起来以制作视频,是视频创作和电影制作中的一项关键技术。传统流程需要大量的人力投入和专家协作,导致生产周期长、人力成本高。为解决这一问题,我们利用生成模型自动化了这一过程,称之为生成式视频合成。这项新任务旨在以交互方式自适应地将前景视频的身份和运动信息注入目标视频,允许用户自定义最终视频中添加的动态元素的大小、运动轨迹和其他属性。具体而言,我们基于扩散Transformer(DiT)的内在特性设计了一种新颖的DiT流水线。为了保持目标视频编辑前后的内容一致性,我们改进了一个轻量级的基于DiT的背景保留分支,并引入了掩码令牌注入。为了继承来自其他来源的动态元素,我们提出了一种使用全自注意力机制的DiT融合块,并辅以一种简单而有效的前景增强策略用于训练。此外,为了根据用户控制融合不同布局的背景和前景视频,我们开发了一种新颖的位置编码,名为扩展旋转位置编码(ERoPE)。最后,我们为这项任务策划了一个包含6.1万组视频的数据集,名为VideoComp。该数据集包含完整的动态元素和高质量的目标视频。实验表明,我们的方法有效地实现了生成式视频合成,在保真度和一致性方面优于现有解决方案。
大型语言模型(LLMs)的最新发展伴随着大量新颖的优化深度学习模型损失的方法和思想的涌现。这些方法声称的优势众多:从更快的收敛速度到消除对某些超参数的依赖。然而,用于验证这些主张的实验协议多样,使得方法间的直接比较充满挑战。本研究对标准化的大型语言模型预训练场景中的最新优化技术进行了全面评估,系统地改变了模型大小、批次大小和训练时长。通过对每种方法的精心调优,我们为实践者提供了针对不同场景选择最合适优化器的指导。对于研究人员,我们的工作指明了未来优化研究的有前景方向。最后,通过发布我们的代码并使所有实验完全可复现,我们希望我们的努力能有助于未来方法的开发和严格的基准测试。
传统的大型视觉语言模型(LVLMs)对齐方法主要依赖于人工标注的偏好数据。人工生成的偏好数据成本高昂;机器生成的偏好数据质量有限;而自监督偏好数据常引入幻觉。为克服这些局限性,我们提出了一种受人类协作学习启发的创新性“同行小组”学习框架。该方法利用一个由多个LVLM组成的“小组”,每个模型通过迭代的自我改进过程,评估并从它们的集体输出中学习。通过模拟同行评审系统,我们的模型针对一组精选的提示生成、评估和完善输出,模仿了课堂学习环境。我们证明了这种方法无需大量人工标注数据集即可提升模型性能。我们的实验表明,在多个基准测试中取得了显著改进,展示了同行评估作为自监督对齐的可扩展替代方案的潜力。值得注意的是,我们表明“同行小组”方法将十五个基准测试的平均得分从48%提高到57%。