近乎自主的 AI 化学家改进了关键药物制造反应
OpenAI 和 Molecule.one 成功展示了一个由 GPT-5.4 模型驱动的近乎自主的 AI 化学家系统,用于优化药物制造中的关键高难度化学反应。通过将先进人工智能与自动化化学合成平台相结合,团队开发出了一种能够识别卓越反应条件的自主工作流。这种大模型与实体实验室的集成,代表了利用代理式 AI 加速现实科学发现和药物研发的里程碑。
每天一次,过滤 AI 噪音
OpenAI 和 Molecule.one 成功展示了一个由 GPT-5.4 模型驱动的近乎自主的 AI 化学家系统,用于优化药物制造中的关键高难度化学反应。通过将先进人工智能与自动化化学合成平台相结合,团队开发出了一种能够识别卓越反应条件的自主工作流。这种大模型与实体实验室的集成,代表了利用代理式 AI 加速现实科学发现和药物研发的里程碑。
Anthropic 已在首尔开设新办公室,以建立常驻机构并将其 Claude 模型整合到韩国的 AI 生态系统中。作为此次扩张的一部分,NAVER 和 Nexon 已经部署了 Claude Code 以优化其软件工程流水线。包括 LG CNS、Hanwha Solutions 和 Samsung SDS 在内的大型企业也正在集成 Claude 来管理代理式工作流。此外,Anthropic 正与韩国国家 AI 研究实验室合作,向多家主要韩国大学提供模型访问权限。
Artificial Analysis 平台宣布 GLM-5.2 在其智能指数(Intelligence Index)中占据了领先的开放权重模型地位。GLM-5.2 超越了以往的开放权重模型,在模型效率和自然语言处理能力方面表现出显著改进。在相关基准测试中,通过对标准对话、数学推理和代码基准进行评估,测量了该模型的延迟、吞吐量、令牌生成速度和成本效率。这一里程碑标志着实时应用中专有系统与开源替代方案之间的性能差距正在缩小。
美国政府决定暂缓将中国人工智能公司 DeepSeek 列入黑名单,尽管已将其他 100 多家实体列为国家安全风险。这一决定凸显了围绕国际机器学习开发、出口管制和开源协作的复杂地缘政治紧张局势。通过避免立即将其列入黑名单,美国政府在国家安全优先事项与依赖集成生成式 AI 技术的全球开发者生态系统可能受到的干扰之间取得了平衡。与此同时,其他公司被列入安全名单表明联邦政府对技术转让保持持续警惕。
Anthropic 派遣了一位知名黑客和安全研究员与政策制定者接触,以缓解政府对人工智能安全性的担忧。这一主动举措旨在通过直接展示其 Claude 系列大型语言模型中内置的对齐技术、红队测试流程和漏洞评估,来证明 Anthropic 对安全工程的承诺。此次协作旨在建立信任,弥合技术 AI 对齐与政府政策预期之间的鸿沟,并在全球对下一代人工智能系统日益严格的监管审查中设定明确的安全基准。
OpenAI 强调了人工智能模型如何成功优化了对药物化学至关重要的历史性高难度化学反应。通过利用先进的计算能力和数据驱动的预测模型,AI 驱动的系统分析了复杂的反应路径,识别出显著提高产率和选择性的新型催化剂、试剂和条件。这一里程碑展示了机器学习在辅助人类科学家探索巨大化学空间、加速候选药物合成与药物发现方面的潜力,并确立了计算机辅助化学研究的新范式。
Claude 发布了一份战略指南,详述了如何构建成功的 AI 原生初创公司。该指南探讨了将开发重心置于人工智能而非将其作为附加功能时,所需的底层设计变革、工程工作流程和商业模式。涵盖的关键方法包括利用基础模型、管理高推理成本、围绕概率输出设计用户体验,以及从提示词工程向健壮的代理架构转型。它强调了建立数据飞轮和执行专有微调对于获得可持续竞争优势的重要性。
开发者 Evan Klem 推出了 Polypore,这是一个开源项目,旨在挑战依赖 IDE 中简单对话框的 AI 辅助编程接口的标准范式。该项目提出了一个从零构建、深度集成的空间用户界面,以支持自主、协作的 AI 代理。通过超越传统的侧边栏,Polypore 探索了新的 UX 模型和系统模式,使软件开发人员能够在高度情境化的环境中指导高层架构变更、监督代理流程并审查输出。
Adam (YC W25) 推出了 CADAM,一个旨在通过 AI 代理生成机械设计的开源文本转 CAD 平台。基于计算机辅助设计应作为代码生成的理念,CADAM 将自然语言提示直接转换为代码并将其渲染为参数化 3D 模型。技术栈利用 React 前端、TanStack Start 以及 Supabase 后端进行数据库管理、身份验证和文件存储。该平台作为传统 CAD 环境的开源替代方案,将自动化和软件开发范式引入了机械原型设计中。
Greptile 推出了 TREX,这是一个 AI 驱动的代码审查系统,旨在安全沙箱环境中执行代码,而不是仅仅依赖静态文本分析。通过执行代码,TREX 可以观察动态运行时行为、识别执行错误、检测性能瓶颈并发现传统静态扫描器忽略的逻辑缺陷。将大型语言模型与动态运行时验证相结合,使系统能够直接针对拉取请求生成高度准确的反馈,从而简化调试工作流程并改进自动代码质量验证。
OpenAI 正式发布了 GPT-Realtime-2,这是其实时对话模型技术的重大更新。这一新迭代旨在提高延迟、提升响应保真度并实现更自然的双向通信流。通过更新模型底层架构,该系统实现了人类级别的对话速度和商业多模态系统内更具响应性的交互。此次发布代表了 OpenAI 对低延迟生成式语音和音频交互的持续战略关注,以减少对话延迟。
Sakana AI 正式推出了其首款商业产品 Sakana Marlin,旨在自动化专业研究流程。作为一款自主研究助手,该工具旨在以最少的人工干预收集、合成和分析复杂信息。此次发布标志着这家日本研究公司向商业化的重大转型,将其专业的生成式 AI 能力转化为可扩展的企业工作流,以加速专业知识密集型决策。
Luma Labs 正式发布了其最新的生成式视频模型 Ray 3.2,在视频质量、处理速度和时间一致性方面进行了改进。此外,Luma Labs 已将该模型集成到 Runware 平台上,扩大了开发者对文本转视频和图像转视频工具的访问权限。此部署支持生成带有先进起始帧和结束帧控制的 5 秒或 10 秒视频片段。
Kling AI 正式发布了 Kling 3.0,对生成式视频平台在渲染细微人类表情和复杂情感方面的能力进行了重大更新。此次更新专注于高保真表现、逼真的角色动画和视觉一致性。团队随后展示的视频演示了该模型在处理复杂、高风险电影级动作和流畅交互场景合成方面的能力。
艾伦人工智能研究所推出了 MolmoMotion,这是一款先进的 3D 运动预测模型,旨在预测空间环境中的物体运动。通过分析少量视频帧序列和物体上指定的 3D 点,该系统可以生成精确的轨迹并预测未来的运动。这项研究代表了空间智能的一个里程碑,改善了计算机视觉系统对现实环境内物理交互的建模与预测方式。
AutoScientist 推出了一个新平台,通过持续试验、适应和优化训练数据集及模型配置,自动化人工人工智能开发流程。通过雇用自主机器学习代理来管理实验生命周期,该系统旨在提高研发速度并减少模型细化期间所需的人工监督。这种持续优化框架为精简开发基础设施提供了一种可扩展的方法。
一项全球协作计划已经启动,旨在优化 Gemma 模型的运行效率和操作速度。该项目调动了一个由 100 多个分布在不同国际地点的软件代理组成的网络并发工作,以协调技术任务。这一举措展示了直接应用于大规模开源语言模型架构优化的协作式多代理框架。
John Schulman 透露,奠基性的近端策略优化(PPO)强化学习论文最初被 2017 年神经信息处理系统(NIPS)会议拒绝。尽管学术起步艰难,但 PPO 已成为行业标准的策略梯度方法,被广泛用于对现代大型语言模型进行对齐。这一披露凸显了机器学习研究中同行评审的主观性。
研究人员推出了 LoopCoder-v2,这是一个从零开始在 18T 令牌上训练的 7B 并行循环 Transformer(PLT)代码模型家族。该工作通过使用跨循环位置偏移和共享 KV 门控滑动窗口注意力机制,解决了顺序循环的延迟和内存开销问题。评估显示了非单调的循环次数效应,其中双循环配置产生了显著提升,将 SWE-bench Verified 分数从 43.0 点提高到 64.4 点,将 Multi-SWE 分数从 14.0 点提高到 31.0 点。相反,超过两次循环的扩展会由于改进增益的递减和固定的位置失配成本而降低性能。
研究人员提出了近端策略优化区域(ZPPO),这是一种替代性后训练框架,它将教师的指导保留在提示中,而不是注入到策略梯度中。该方法旨在防止学生模型在困难任务的强化学习过程中专注于僵化的教师模式或遭遇策略漂移。ZPPO 在提示重放缓冲区中使用包含二元和负面候选者的提示来辅助学生的学习进度。在 Qwen3.5 模型家族从 0.8B 到 9B 的规模上进行测试表明,ZPPO 的表现始终优于传统的离线或在线策略蒸馏及 GRPO。
研究人员发布了 ProCUA-SFT 数据集,这是一套从 93,000 条合成桌面轨迹中蒸馏出的 310 万个步骤级监督微调样本。该数据集使用包含实时桌面任务、SpreadsheetBench 和 Zenodo10K 幻灯片的自动化流水线构建,解决了与 AgentNet 等人类桌面轨迹数据集相关的负迁移问题。在 ProCUA-SFT 上对 UI-TARS 7B 模型进行微调,使其 OSWorld 基准成功率从 26.3% 提高到 45.0%。该训练数据的一个子集也被用于增强 Nemotron 3 Nano Omni 模型的计算机使用能力。
研究人员介绍了 OPD-Evolver,这是一个利用在线策略自蒸馏设计自进化代理的慢快协同进化框架。快循环利用四级内存层次结构在推理时使用和维护经验,而慢循环采用结果校准的记忆归因和事后回顾将这些能力蒸馏到策略中。在多领域基准测试中评估,OPD-Evolver 的表现比 ReasoningBank 记忆系统高出 11.5%,比基于训练的 Skill0 基线高出约 5.8%。该模型的 9B 参数版本表现出挑战 Qwen3.5-397B-A17B 等超大规模模型的能力。
研究人员提出了循环世界模型(LoopWM),这是一种新颖的循环架构,旨在解决世界模拟中深层计算需求与部署效率之间的矛盾。通过单个参数共享 Transformer 块迭代细化潜在环境状态,LoopWM 与传统架构相比,参数效率提高了 100 倍。该框架动态扩展深度以匹配预测任务的难度,并将迭代潜在深度确立为模拟环境转换的替代扩展轴。
研究人员引入了 d-OPSD,这是第一个专门为扩散大型语言模型(dLLM)定制的在线策略自蒸馏框架。传统的在线策略蒸馏方法依赖于从左到右的令牌级监督,这与基于扩散模型的任意顺序生成相冲突。d-OPSD 方法使用自生成的答案作为后缀调节来从“自我未来经验”中学习,并将监督移动到与迭代去噪对齐的步骤级格式。在四个推理基准测试中测试,d-OPSD 表现优于 RLVR 和 SFT 基线,同时仅使用了 RLVR 所需优化步骤的 10%。
研究人员提出了 ActWorld,这是一种交互式世界模型,旨在支持块自回归视频生成框架内的中途对象交互。ActWorld 利用包含思维链标注的 10 万个人机交互视频数据集,解决了现有的动作遗忘和数据瓶颈问题。它具有一个分层的动作感知记忆系统,根据交互的重要性引导历史压缩,并由一个跟踪事件更新和对象身份的持久记忆库提供支持。结果证明了其交互保真度和一致的视点控制。
研究人员分析了可验证奖励强化学习(RLVR)的梯度动态,展示了 GRPO 式优化如何根据优势符号和令牌分布易受训练崩溃的影响。为了提高稳定性,他们引入了优胜者优势策略优化(WAPO),这是一种截断策略梯度目标,专门对具有正优势的完成结果执行更新。在数学推理和多跳问答基准测试中评估,WAPO 在多个模型家族中始终达到或超过传统基线算法的表现。