推出经济研究交流平台
OpenAI启动了“经济研究交流平台”(Economic Research Exchange),这是一项旨在研究和分析人工智能技术对劳动力市场、经济增长和全球生产力影响的协作计划。该项目目前正在接受精选研究项目的申请,为研究这些社会经济转型的学术和专业研究人员提供平台和潜在资源。该倡议旨在加深对AI集成如何重塑全球经济中就业和生产力模式的集体理解。
每天一次,过滤 AI 噪音
OpenAI启动了“经济研究交流平台”(Economic Research Exchange),这是一项旨在研究和分析人工智能技术对劳动力市场、经济增长和全球生产力影响的协作计划。该项目目前正在接受精选研究项目的申请,为研究这些社会经济转型的学术和专业研究人员提供平台和潜在资源。该倡议旨在加深对AI集成如何重塑全球经济中就业和生产力模式的集体理解。
中国机器人制造商宇树科技(Unitree)正在筹备首次公开募股(IPO),其人形机器人出货量即将达到1万台。在过去12至18个月内,宇树将其旗舰G1人形机器人的税前价格从5万美元以上降至2.73万美元,同时保持了67%的毛利率。公司计划投入约3亿美元用于AI研发,并拥有三位数的同比增长率,其利用QDD执行器设计获得了结构性的成本优势。目前,已有超过250台其人形机器人部署在现实劳动力场景中。
苹果公司正式推出了Apple Intelligence,这是一个为iPhone、iPad和Mac深度集成设计的个人智能化系统。该框架利用端侧生成式AI模型结合用户个人情境,通过Siri提供更自然、更具情境感知的助手服务。该系统由Private Cloud Compute支持,通过端侧和安全的Apple Silicon服务器进行数据处理,以确保用户隐私。苹果的WWDC 2026大会还发布了关于iOS 27以及与Google Gemini模型集成的战略架构的相关报告。
MiMo-v2.5-Pro-UltraSpeed人工智能模型架构已发布,规模扩展至万亿参数。该模型解决了超大规模神经网络部署中的延迟和计算瓶颈,实现了每秒1000个Token的推理速度。它利用先进的推理优化、专有的软硬件协同设计以及并行化策略,使超大规模生成式模型能够以适合企业应用和交互式智能体的实时响应速率运行。此次发布为大规模模型的高吞吐推理性能设立了新基准。
行业出现共识,认为前沿大语言模型的训练进展正面临边际效益递减期,即所谓的“缩放定律趋于平缓”。尽管在更大规模数据中心投入了数十亿美元,但模型代际间的性能提升已不如GPT-3到GPT-4时期那样显著。导致这一现象的因素包括高质量人类文本数据的减少,以及高昂的电力和经济成本,这促使企业将重心转向算法效率和可持续工程。
YC S22初创公司Intuned发布了一个平台,旨在将浏览器自动化作为代码进行构建、部署和维护。该平台专为缺乏API的网页设计,利用自主AI智能体处理数据抓取、报告检索和表单提交。系统捕获全面的执行元数据,使AI智能体能够在目标网站进行结构或设计更新时自动修复并调试底层代码,从而消除人工维护成本。
作者发布了一篇后续分析,回应了公众关于大语言模型如何改变软件工程职业的反馈。文章综合了读者对人机协作、开发者生产力预期变化以及深度技术专业知识贬值的看法。探讨了行业对自动化代码生成的集体焦虑、代码同质化的威胁,以及开发者角色从积极、创造性的问题解决者向被动系统监控和验证者的转变。
OpenEnv已转型为由多方利益相关者委员会监督的去中心化治理模型,以指导其开放智能体强化学习(RL)栈。新成立的委员会由主要的AI组织和行业领导者组成,包括Meta-PyTorch、Hugging Face、Nvidia、Unsloth、Reflection、Modal、Prime Intellect、Mercor和Fleet AI。这一协作努力旨在通过结合共享的工程资源和集体战略监督,加速开源智能体RL架构的开发。
Boris Cherny和Cat Wu发布了一份技术回顾,庆祝Claude Code正式发布一周年。更新概述了系统“自动模式”(auto mode)背后的架构动机,重点介绍了稳定自主编程工作流的验证最佳实践和健壮的迭代执行循环。展望未来,开发路线图将重点提高智能体在自动化软件工程管线中任务处理的可靠性和直接自主性。
Anthropic发表了一篇新的科学博客,解释了为什么生物学研究进展在AI模型采用方面落后于软件工程。分析表明,当代生物学数据库类似于遗留的市政基础设施,并未为自主智能体进行结构化设计。Anthropic强调,为了通过智能体框架加速生命科学领域的科学发现,必须对这些生物数据结构进行彻底的改革和优化。
Runway推出了一款AI驱动的通用视频重构工具,旨在自动化主流社交媒体平台的内容适配。利用生成式AI,该工具允许创作者上传单个视频源,并自动将其重构为适合TikTok、Instagram Reels和YouTube Shorts的不同宽高比。该工具旨在简化内容创作工作流,并在无需传统繁琐人工编辑的情况下保持高视觉保真度。
沃顿商学院发表的一篇研究论文指出,生成式人工智能技术必须在目标行业中实现2.7倍的生产力增长,才能证明当前的市场估值和企业资本支出的合理性。研究结果强调,需要迅速实现这些大规模的运营效率提升,以避免基础设施支出与财务产出之间的严重错配。这项研究引发了显著的行业讨论。
研究人员推出了Socratic-SWE,这是一种闭环自我进化框架,旨在利用软件工程智能体自身的历史求解轨迹来训练它们。与传统的合成数据生成不同,Socratic-SWE将执行轨迹提炼为详细记录反复出现的故障和修复模式的结构化技能,并用于生成针对性的修复任务。该框架经基于执行的测试验证并使用求解器梯度对齐奖励进行评分,在三轮训练迭代后,在SWE-bench Verified上达到了50.40%的准确率。在SWE-bench Verified、Lite、Pro及Terminal-Bench 2.0上的评估显示,Socratic-SWE的表现持续优于自我进化的基准模型。
研究人员提出了SIA,这是一种统一的自我改进循环,其中反馈智能体同时更新执行框架(harness)和特定任务智能体的底层权重。虽然以往的方法将框架重写与模型微调隔离开来,但SIA集成了这两种机制以增强智能体的规划能力和领域特定直觉。在中文法律罪名分类(LawBench)、GPU内核优化和单细胞RNA去噪任务中,该方法的表现显著优于单一的框架迭代。在LawBench上性能提升了56.6%,GPU内核运行时间缩短了91.9%,去噪任务改善了502%。
研究团队开发了StreamForce,这是一个因果流式视频生成框架,能够利用连续的力输入实现实时的、基于物理基础的控制。与以往依赖不同系统处理不同力或非因果处理的模型不同,StreamForce是一个统一模型,能够响应随时间变化的局部和全局力输入,同时保持光度和动态的真实感。该系统由新设计的力可控蒸馏管线支持,在单个GPU上运行速度高达16.6 FPS。它提供了稳定的生成效果,并在力合规性和运动保真度方面优于之前的基准。
研究人员开发了DistIL,这是一种利用多维反馈(如执行轨迹、工具输出和自我评估)的强化学习方法,超越了简单的二元奖励。基于DAgger模仿学习算法的分布式变体,DistIL采用了一种前向交叉熵损失函数,通过将未来的专家-学生不匹配传播到过去的决策中,促进了稳健的信用分配。作者证明了该目标函数确保了单调的策略改进和理论上的遗憾界限。在经验评估中,DistIL在科学推理、编程和数学方面的表现均持续优于从可验证奖励中进行强化学习(RLVR)的标准方法。
为了解决固定智能体架构的局限性,研究人员提出了HarnessForge,这是一个用于LLM智能体系统联合进化的元自适应框架。HarnessForge将智能体系统结构化为成对的执行框架(harness)和策略,通过故障引导的框架定制和框架条件下的策略对齐实现协同进化。在五个不同基准测试中的评估显示,该框架改进了Qwen3-4B和Qwen3-8B基准模型,比仅使用框架或仅使用策略的方法提升了多达12.0%。实验表明,执行结构与内部推理参数的联合优化显著增强了整体系统性能和部署效率。
研究人员提出了OpenSkill,这是一种为在没有预先策划的技能、目标任务监督或人类验证者的情况下部署的LLM智能体设计的开放世界自我进化框架。OpenSkill使智能体能够通过从网络资源和文档中检索知识和验证锚点,自主启动学习循环。它将这些材料合成可转移技能,并使用自生成的虚拟练习任务对其进行提炼。在三个基准测试中,OpenSkill在保持严格零监督约束的同时实现了最高的自动通过率。所生成的技能成功地在不同的语言模型主干之间进行了转移,无需针对特定模型进行再训练。
一种名为在线策略扩散语言模型(OPDLM)的新方法被引入,用于将自回归语言模型转换为扩散语言模型。为了防止数据分布偏移和预训练知识的丢失,OPDLM使用了在线策略蒸馏(OPD)目标,即具有双向注意力的学生模型生成自己的文本轨迹,而冻结的教师模型提供训练Logits。这种在线策略蒸馏方法消除了传统扩散模型中常见的训练-推理不匹配问题。OPDLM在任务中表现强劲,同时训练Token使用量减少了15倍到7000倍。
研究人员研究了在向学生模型蒸馏知识之前对长思维链推理轨迹进行事后压缩的方法。使用Qwen3.5-397B-A17B和gpt-oss-120B教师模型生成的283k条轨迹,指令微调模型将序列压缩至原始长度的8.6-21.0%。在48个实验配置下的评估显示,压缩轨迹将训练Token降低至原始输入的12-30%,将训练速度提高了2.0-7.6倍并缩短了推理输出。然而,原始轨迹保持了最高精度,这揭示了一个明显的性能-效率权衡,即学生在获得18倍Token效率的同时保留了高达96%的精度。