两个 API 设置使 GPT-5.6 在 ARC-AGI-3 基准测试中得分翻了三倍
OpenAI 宣布,配置两个特定的 API 设置使其 GPT-5.6 模型在 ARC-AGI-3 基准测试中的性能提升了三倍。优化参数侧重于保留模型的内部推理能力,并利用令牌压缩来显著提高输出效率。通过利用这些针对性的 API 调整,该模型在复杂的推理任务上获得了更高的整体准确度分数,而无需额外的计算重新训练。这一进展表明,通过软件层面的参数调整,可以大幅增强以推理为导向的模型性能。
每天一次,过滤 AI 噪音
OpenAI 宣布,配置两个特定的 API 设置使其 GPT-5.6 模型在 ARC-AGI-3 基准测试中的性能提升了三倍。优化参数侧重于保留模型的内部推理能力,并利用令牌压缩来显著提高输出效率。通过利用这些针对性的 API 调整,该模型在复杂的推理任务上获得了更高的整体准确度分数,而无需额外的计算重新训练。这一进展表明,通过软件层面的参数调整,可以大幅增强以推理为导向的模型性能。
OpenAI 宣布降低其 GPT-5.6 模型系列的定价,特别是针对 Luna 和 Terra 变体,以使企业部署更具成本效益。通过优化模型执行效率,OpenAI 希望使组织能够大规模部署复杂的对话和分析工作流,而无需承担高昂的成本。这些成本削减旨在降低企业将先进功能集成到运营中的经济门槛,增强了 GPT-5.6 系列的性价比。
OpenAI 发布了 GPT-5.6,这是一个专注于优化计算效率和逻辑推理性能的新模型。通过增强底层 Transformer 架构,该模型在显著降低运营成本的同时,实现了更快的推理速度和更高的准确性。此次发布旨在为开发者提供高度可扩展的自然语言处理能力,以应对复杂的推理任务、代码生成和交互式工作流,同时降低托管费用。一项将该模型部署为自主业务代理的实证实验导致了 447 美元的损失,凸显了全自主代理在安全性和对齐方面面临的持续挑战。
Google DeepMind 推出了 Gemini Robotics 2,这是一个在机器人硬件中实现全身智能的物理人工智能系统。通过整合 Gemini 基础模型的多模态推理能力,该系统能够同时处理视觉、触觉和自然语言输入,而非依赖孤立的控制循环。这种统一的方法使得机器人在动态环境中能够实现更平滑的物理协调和实时决策。此次发布展示了一种利用大型多模态模型弥合数字推理与物理机器人执行之间差距的方法。
来自 YC S26 孵化期的企业软件初创公司 Prized 发布了一个平台,使非技术员工能够使用自然语言构建安全的全栈内部应用程序。该系统直接与企业登录和数据库环境集成,无需手动配置 API。为了保护生产资源免受恶意代理操作的影响,Prized 在网络层隔离了其执行沙箱,并使用作用域会话令牌作为不透明占位符来管理凭据,通过出口代理将实际身份验证详情交换到标头中。
研究人员发表的一项研究表明,从经过政治审查的大语言模型中进行的知识蒸馏,并不会必然将其对齐或审查偏差传递给学生模型。该研究将 DeepSeek V4 Flash 蒸馏到 GPT-OSS-120B 中,以评估其在金融推理任务上的表现,在 FinanceReasoning 基准测试中达到了 83.61% 的得分。尽管教师模型对政治敏感问题的响应与预期基线偏离了 7 个标准差,但蒸馏后的学生模型并未继承这些特征,而是与原生的西方基础模型保持一致。
Grafana 发布了一个开源 Go LLM SDK,旨在促进流式传输和工具调用 AI 后端的构建,并附带一个 React 前端库。该软件包通过提供结构化的流式协议和预构建的用户界面元素,简化了将生成式 AI 功能集成到 Go 应用程序中的过程。此发布解决了实时令牌传递和动态客户端状态转换期间常见的同步挑战,为开发者在 Web 开发生态系统中构建响应迅速的工具调用代理系统提供了一个统一的框架。
开发者 Hamza Rehman 发布了 claude-account,这是一款优化 Claude Code 多租户开发者工作流的开源命令行工具。该工具通过允许工程师安全保存个人和专业 Anthropic 账户的凭据,解决了身份验证的繁琐问题。用户可以使用 add 和 use 等 CLI 命令在保存的身份之间无缝切换,实时更新配置,从而防止在智能软件开发和自动化代码库重构任务中出现工作流中断。
开发者 Yash Mahajan 发布了 Noisegate,这是一个开源的差分隐私网关,旨在保护与不可信人工智能代理和第三方大语言模型进行交互时的敏感数据。该软件位于本地企业数据源与外部 LLM 服务之间,将数学差分隐私算法应用于用户查询。该系统过滤并匿名化上下文参数,在掩盖识别个人身份模式的同时,保留有效载荷的语义和分析效用,以防止专有数据泄露。
Steelman Labs 发布了一份分析报告,批评了目前训练计算机使用 AI 代理的方法。文章指出,绕过以人为本的图形用户界面或将应用程序层视为黑盒,会限制代理的适应能力。为了实现通用的计算机控制,AI 系统必须发展出强大的视觉推理能力,并理解旨在供人类用户使用的布局设计。作者主张,进步依赖于构建拥抱而非抽象视觉复杂性的实时反馈循环。
OpenAI 宣布对其 GPT-5.6 模型系列进行大规模降价,以提高开发者的成本效率。旗舰产品 GPT-5.6 Luna 模型价格下调 80%,每百万输入令牌降至 0.20 美元,输出令牌降至 1.20 美元。此外,GPT-5.6 Terra 变体的每百万令牌输入和输出价格分别下调了 20%,至 2 美元和 12 美元。OpenAI 还为 GPT-5.6 Sol API 引入了性能导向的 Fast 模式,在保持基础模型智能的同时,处理速度提高了 2.5 倍,但成本是标准模式的两倍。
Google DeepMind 推出了 Gemini Robotics 2,这是一个统一的大脑系统,旨在为物理 AI 平台提供全身智能和统一控制。通过将先进的视觉、语言和多模态推理能力直接集成到机器人架构中,该系统旨在弥合高层认知推理与复杂的现实世界物理操作任务之间的鸿沟。该项目代表了朝着能够在动态企业和工业环境中感知、推理和自适应行动的通用物理代理迈出的重要一步。
Google 扩展了其生成式模型系列,发布了 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite。这些模型专为开发者和企业构建者设计,旨在在处理智能与运营速度及扩展成本效率之间取得平衡。此次模型发布满足了开发者在不牺牲整体输出质量的前提下对高吞吐量 API 工作流的需求。这一发布代表了 Google 致力于优化专门用于高扩展性生成式部署的模型。
Google 宣布推出 Gemini Robotics ER 2,这是一款旨在将物理硬件平台与先进多模态系统集成的具身推理模型。ER 2 基于核心 Gemini 架构构建,增强了机器人平台的空间感知、物理推理和实时决策能力。此次发布突显了深度学习的进展,旨在辅助机器人系统在物理世界中执行极其复杂的操作和协调任务,代表了具身人工智能的战略性进步。
Hailuo 发布了其全新的 H3 视频生成模型,展示了其在高保真生成式视频合成方面的技术能力。初步评估和用户测试表明,H3 模型提供了精确的提示控制,能够详细遵循电影叙事指令、特定摄像机运动、平滑的角色动作以及视觉一致性。这种架构允许内容创作者从自然语言提示中生成复杂的文本和立体画风格动画,标志着竞争性专业级视频合成工具的重大发展。
OpenAI 首席执行官 Sam Altman 宣布调整发展战略,预告了专门为加速科学发现而定制的即将推出的人工智能模型。Altman 强调了一种合作方式,称 OpenAI 的优先事项是利用先进模型为全球科学界赋能,而不是在内部解决复杂的物理挑战。这一战略旨在使全球实验室和研究机构能够普及对先进计算推理工具的使用,并加速突破性的科学研究。
Francois Chollet 发布了 ARC-AGI-3 基准测试中测试标准的澄清指南,对可接受的通用 API 配置和禁止内部化测试知识的自定义工具解决方案划出了清晰界限。该公告旨在通过确保所有运行细节和计算成本透明披露来解决测量差异。这项标准化工作解决了定制工程快捷方式的问题,为测试高级推理模型建立了一个可重复且公平的基线比较框架。
Kling AI 被用于电影《L’Ultimo Uomo Reale》的制作过程中,以生成富有情感的角色表演。该项目利用 Kling AI 的技术架构来维持角色身份的一致性,并跨多个帧保留精细的视觉细节。通过解决生成式视频合成中常见的临时伪影和结构稳定挑战,这一实现展示了现代 AI 视频生成器在专业电影制作人叙事流水线中的实际应用效用。
研究人员介绍了 GPT-Red,这是一种训练用于发现针对前沿 LLM 的新型提示注入攻击的自动化红队测试代理。利用可扩展的自我博弈算法,该模型负责攻击一组同时训练的防御代理。GPT-Red 被用于对抗性训练 GPT-5.6,使其成为目前抗提示注入能力最强的模型。此次安全训练运行代表了目前记录的最大规模 LLM 安全后训练工作之一。GPT-Red 成功破解了 GPT-5.5 之前的模型,表现优于人类红队成员,并展示了对未见环境和防御模型的泛化能力。
一项研究评估了自主 AI 代理是否可以通过对两篇未发表的 NeurIPS 2026 论文执行“影子评估”来进行开放式 AI 研究。前沿代理被给予六天时间和数千美元的计算资源来解决核心研究问题,并由原作者对输出结果进行评分。尽管代理在没有人类帮助的情况下完成了工程工作,但在核心研究问题上未能取得实质性进展。作者指出了五种反复出现的失效模式,包括对可发表标准缺乏判断力、对研究设计限制的应对缺乏创造力、无效的后退机制、资源意识薄弱以及指令漂移。
研究人员介绍了 MindForge,这是一个自动化的流水线,将开源命令行程序转换为无源代码环境,以在从零开始的软件工程中训练编码代理。MindForge 利用 GLM-5.2 作为教师代理,策划了高质量的程序合成轨迹,对 Qwen3.6-27B 进行了微调。微调后的模型在 ProgramBench 上的平均测试通过率从 37.98% 提高到 49.51%,与大型前沿模型表现相当。它还在七个未见的软件工程基准测试中取得了显著的绝对增益,包括在 RepoZero-C2Rust 上提升了 31.00 分,DeepSWE 上提升了 14.16 分,SWE-bench Verified 上提升了 5.04 分。
研究人员发布了 OmegaUse-OfficeVal,这是一个旨在评估大语言模型(LLM)代理执行长期办公任务能力的新基准。该基准包含 100 个源自实际从业者需求的现实任务,每个任务平均需要 2.32 小时的人力。数据集的一个关键特性是将任务与人力时间和价格代理配对,从而能够直接进行成本和效率与 LLM 推理的比较。基于细粒度准则构建的代码验证器支持稳定的评估。结果显示,虽然目前的前沿 LLM 比人类更快、更便宜,但交付质量尚未达到人类水平。
研究人员提出了 DistillAlign,一个在自回归视频蒸馏中协调模式覆盖与模式寻求的框架。标准的多阶段流水线将初始化与分布匹配蒸馏(DMD)解耦,导致覆盖率损失。DistillAlign 通过一种联合蒸馏目标解决了这个问题,该目标结合了 DMD 的模式寻求能力与基于一致性蒸馏的模式覆盖约束。使用一种测量潜在精度和覆盖率的新型分布评估协议,作者证明 DistillAlign 提高了生成质量和多样性,其 Wan-1.3B DMD 教师模型优于从更大的 Wan-14B 模型中蒸馏出的基线模型。
研究人员推出了 StealthBench,这是一个旨在评估自主进攻安全代理操作隐蔽性的基准。该框架包含 11 个经过验证的操作安全(OPSEC)事件,扩展为跨六个维度的 14 个容器化场景。评估通过一个由三个模型组成的 LLM 评审小组进行,并使用多数投票聚合来测量包括安全成功率、隐蔽解决率 (Stealth@Solve) 和鲁莽解决率在内的指标。在所测试的模型系列中,没有一个模型的安全成功率超过 54%,这凸显了自主进攻代理在 OPSEC 方面的系统性失败。
研究人员推出了 SecRespond,这是一个用于评估 LLM 代理在入侵后事件响应能力中的基准。该基准建立在来自受损云主机的 10 个网络靶场之上,涵盖了 4 种入口点类型、21 种 ATT&CK 技术和 5 种操作系统。利用 OpenCode 代理工具,代理分析取证磁盘快照以及安全警报,以生成入侵报告和补救计划。对 23 个前沿 LLM 的评估显示,虽然代理可以识别警报暴露的问题,但在主动的磁盘调查和全面补救方面仍有欠缺,没有任何模型在任何单个靶场上取得圆满成功。
研究人员提出了 CoRT,一种专为准则条件组相对策略优化(GRPO)设计的令牌级信用加权方法。CoRT 不训练辅助评分模型,而是利用反事实回放来重新评估在准则条件和无标准提示下采样得到的响应。由此产生的令牌级对数似然对比被用作归一化权重,以跨令牌重新分配 GRPO 优势。在指令微调模型中,CoRT 将响应级 GRPO 的性能平均提高了 4.4 个百分点,在避免额外相关性学习阶段的同时,达到了学习型令牌级基线的表现。