代理 AI 时代的科学计算
OpenAI 发布了一份现场报告,详细介绍了研究人员如何使用 AI 编码代理使科学计算现代化。这些代理 AI 系统实现了复杂数据分析流水线的自动化,加速了软件开发,并更新了基因组学等学科中的遗留科学代码库。通过将代理直接集成到计算工作流中,实验室正在系统地克服传统的软件瓶颈并减少手动编程开销,使科学家能够专注于基础研究和发现,而不是代码维护。
每天一次,过滤 AI 噪音
OpenAI 发布了一份现场报告,详细介绍了研究人员如何使用 AI 编码代理使科学计算现代化。这些代理 AI 系统实现了复杂数据分析流水线的自动化,加速了软件开发,并更新了基因组学等学科中的遗留科学代码库。通过将代理直接集成到计算工作流中,实验室正在系统地克服传统的软件瓶颈并减少手动编程开销,使科学家能够专注于基础研究和发现,而不是代码维护。
研究人员发表了一篇论文,介绍了 Kimi Linear。这是一种线性注意力架构,旨在替代大型语言模型中标准的二次项 Softmax 注意力。该架构利用专门的门控机制和感知硬件的优化内核,将计算复杂度从序列长度的二次方降低为线性。根据 Sebastian Raschka 博客上发表的技术说明,该架构是 Moonshot AI 的 Kimi K3 模型的基础,结合了专家混合路由(MoE)和强化学习,以管理长上下文推理过程中的计算瓶颈。
Fermisense 展示了通过对 9B 参数的开源模型进行 500 美元的强化学习微调,可以在特定的目录审查任务中胜过专有的前沿模型。通过采用针对性的特定领域优化,而不是依赖昂贵的通用商业 API 模型,该训练运行在结构化验证管道中实现了高精度,同时降低了长期推理成本。该项目表明,将高度定制化且注重预算的强化学习应用于较小的开源模型,可以比庞大的商业系统实现更优的领域专用结果。
Anthropic 发布了一项研究,展示了其 Claude 模型如何识别软件系统中的复杂加密漏洞。研究表明,Claude 的自然语言理解和代码分析能力使其能够检测到标准自动扫描器漏掉的微妙实现缺陷、已弃用的算法和侧信道向量。该论文详细介绍了部署前沿大语言模型进行自动漏洞发现的双重影响,解释了它们如何在辅助软件开发者进行代码审计的同时,也带来了被恶意利用的风险。
Model Context Protocol 社区发布了 2026-07-28 规范,将该开放协议的传输层过渡到无状态架构。通过从通信通道中移除会话状态要求,该更新简化了路由机制,提高了应对瞬态网络中断的弹性,并降低了自定义 MCP 端点的集成门槛。该规范定义了更新后的请求-响应模式和错误处理协议,为现有的代理集成和无服务器实现提供了无缝迁移。
开发者 schildep 引入了一种在 Lean 4 定理证明器中实现的形式化验证 3D 构造实体几何(CSG)操作。为了解决原始 AI 输出的可靠性限制,人工智能系统被用于自动生成超过 60,000 行数学证明,以验证一个复杂的 1,000 行网格交集内核。人类开发者只需信任 93 行简洁的规范,因为 Lean 编译器会在编译时验证 AI 的证明,从而保证完全的功能正确性和几何良好性。
Google 推出了 Beyond Zero,这是一个全面的企业安全框架,旨在解决在企业环境中部署人工智能所带来的漏洞。Beyond Zero 扩展了传统的零信任安全原则,保障 AI 数据流水线、模型训练环境和推理端点的安全。该架构蓝图指导企业实现安全的数据溯源,为人类操作员和自动化 AI 代理建立访问控制,并防御诸如提示注入和数据投毒等对抗性攻击。
《Communications of the ACM》的一篇评论文章提倡授予大语言模型直接访问 ACM 数字图书馆同行评审计算机科学资源库的权限。作者认为,在结构化、权威的科学文献上训练模型将提高模型的准确性、逻辑推理能力和代码生成能力。这与目前依赖低质量网络数据的训练流水线形成了对比,并将访问学术资源库定位为将生成式 AI 转变为科学研究可靠助手的必要步骤。
研究人员发表了一项研究,分析了在剥离安全护栏以使其“未经审查”后,开源大语言模型的行为变化。研究结果表明,与对齐后的基础版本相比,未经审查模型生成的输出在乐观偏见和积极情绪方面有显著的统计学增加。该研究认为,移除对齐和安全过滤器改变了模型的底层认知框架,使未经审查的模型在系统上比对齐后的模型风险厌恶程度更低且更加乐观。
Google 宣布了其 Gemini Managed Agents API 的重大更新,引入了对模型环境钩子的高级支持。此次更新实现了旨在管理代理工作流内部执行流的新块函数和线性函数。这些添加为开发者提供了更深层次的集成能力、过程监控,以及模型输出与其操作环境之间的更紧密协调。这些工具旨在简化企业生产环境中复杂、反应灵敏的 AI 代理操作。
Runway 正式预告了其最新的生成式视频合成模型 Seedance 2.5 即将发布。即将发布的版本旨在显著提升视频的整体质量、运动连贯性和用户引导的相机控制。该模型旨在为数字内容创作者、电影制作人和艺术家提供高保真的合成能力,标志着 Runway 生成套件向前迈出了关键一步。具体的技术细节和正式发布时间表仍处于保密状态。
Kling AI 开发了利用其 Kling Model Context Protocol(MCP)的新创意工具和功能。此更新旨在将生成式 AI 技术集成到面向用户的社交体验中,促进与社区的更紧密互动。通过部署这些生成功能,公司旨在突显 MCP 的效用并扩大互动内容创作能力。
Kimi 团队发布了 Kimi K3,这是一款新的放大版开源权重大型语言模型。架构分析表明,K3 是去年引入的专有 Kimi Linear 模型架构的生产级扩展版本。通过应用既定的缩放定律和工程改进,开发团队已将其线性框架转型为开源权重模型生态系统中一个极具竞争力的选择。
代理 SEO 的新兴范式正在通过部署自主 AI 代理来重塑传统的搜索引擎优化策略。这些以目标为导向的代理利用复杂的大语言模型,将在线搜索动态从以关键词为中心的内容创作转向意图驱动的发现和主动交互。这种代理工作流的集成被预言将改变企业在由自主数字角色而非被动搜索算法定义的时代管理在线可见性和发现的方式。
Kling AI 发布了其 Creator Off Script 系列的新一集,主角是韩国内容创作者 Daon_box。自今年年初以来,该创作者通过制作 AI 生成的猫咪冒险故事,获得了超过 2000 万次的观看量。这一专题展示了生成式视频合成在故事讲述中的创意应用,演示了现代 AI 视频工具如何允许创作者构建沉浸式叙事内容并吸引全球观众。
Gary Marcus 强调了当前大语言模型在推理和逻辑方面的关键局限,指出它们在没有外部软件工具的情况下始终无法遵守国际象棋的基本规则。Marcus 挑战了数据集的大规模缩放可以产生真正智能或功能性世界模型的观点。他认为,LLM 本质上缺乏基于规则的推理,而依赖外部 API 来修补这些差距并不能解决统计模型中根本的架构局限性。
对现代大语言模型趋势的回顾表明,结构和架构复杂性呈现出显著的增加趋势。开发者和研究实验室没有依赖简单的、标准的 Transformer 缩放,而是设计了复杂的配置来优化模型推理、处理效率和内存约束。这一进化轨迹表明,突破智能的界限需要超出简单参数缩放的复杂架构变革。
研究人员介绍了 Kimi K3,这是一个具有 2.8 万亿参数的专家混合(MoE)模型,拥有 1040 亿个激活参数、原生视觉能力和 100 万 token 的上下文窗口。基于 Kimi Delta 注意力、注意力残差和 Stable LatentMoE 构建,K3 在扩展效率上比其前身提升了 2.5 倍。训练后的亮点包括跨通用、代理和编码领域的强化学习。在多种基准测试中,Kimi K3 的表现始终优于其系列中的其他开源和专有模型,仅次于 Claude Fable 5 和 GPT-5.6 Sol。该模型权重已公开,以加速前沿智能研究。
研究人员介绍了 StateAct,这是一个围绕程序状态构建的、面向长周期计算机使用代理的代码优先多代理框架。StateAct 的主代理不完全依赖截图,而是直接使用代码与程序文件和 API 交互,仅将 1.1% 的步骤委托给 GUI 子代理。在 OSWorld 2.0 基准测试中,StateAct 将 Claude Opus 4.8 的二进制成功率从 20.6% 提高到 26.9%,部分成功率从 54.8% 提高到 61.6%,同时与标准的截图基准相比,任务执行成本降低了约 9 倍。
研究人员引入了一个统一、受控的多轮环境,以研究基础模型代理如何获取、塑造和整合多轮长周期规划。该研究跟踪了三个关键训练阶段的进展:预训练期间的获取、后训练期间通过 GRPO 和策略内蒸馏(OPD)进行的塑造,以及使用多教师策略内蒸馏(MOPD)进行的整合。研究结果表明,通过思维链进行的显式世界建模产生了更强的泛化能力,并且在低质量和长周期设置下,OPD 比 GRPO 提供了更一致的更新方向。
研究人员开发了 WorldDiT,这是一种统一的扩散 Transformer 架构,将连续动作生成与视觉世界建模集成在一起。WorldDiT 专为机器人控制而设计,不依赖大型预训练视觉语言模型作为动作基干,而是生成连续的动作块并预测未来的相机帧。在四个 LIBERO 模拟套件中进行的评估表明,WorldDiT 表现强劲,在报告的模型参数总量和平均成功率的 Pareto 前沿上建立了一个稳健的十亿参数以下基准。
研究人员介绍了 Sol-Attn(即时稀疏注意力),这是一个无需训练的框架,旨在加速视频生成中扩散 Transformer 的推理。Sol-Attn 通过在单次在线 Softmax 过程中结合动态路由、稀疏计算和近似校正,解决了长 token 序列的计算瓶颈。通过利用即时块阈值处理并重用代理分数,它避免了资源密集型的度量具体化。实验表明,在视频生成和编辑方面分别实现了 2.1 倍和 2.3 倍的端到端加速,同时保持了高质量的视觉效果。
研究人员提出了一个系统,将冻结的非确定性语言模型与不断增长的、持久的已验证解决方案内存相结合。该机制实现了之前已解决问题系列的零 token、比特精确且确定性的执行。在跨越九个问题系列的 180 个新实例中,四种不同的模型架构通过使用零生成 token 实现了完美准确度。该系统还扩展了工作上下文,在单个 46GB GPU 上支持 600 万 token 的滑动窗口,绕过了标准的 vLLM 和 SGLang 上下文限制。
研究人员提出了多代理协议蒸馏(MAPD),这是一个联合知识蒸馏和强化学习框架,弥合了代理搜索中专有教师模型与开源学生模型之间的分布差距。MAPD 将探索踪迹结构化为风格归一化的 JSON 协议,为学生模型提供密集的蒸馏信号。在七个 QA 基准测试中,MAPD 提高了平均成功率,在 Qwen3-1.7B 上达到 39.4%,在 Qwen3-4B 上达到 44.4%,同时避免了诸如风格漂移和冗长退化等问题。
研究人员介绍了 OmniVAE,这是一种联合训练的音频-视频变分自编码器(VAE),在音频和视频的潜在空间之间建立了语义对齐。OmniVAE 不再分别训练模态,而是采用了片段级的音频-视频对比目标,以及来自冻结的特定模态编码器的特征蒸馏。这种跨模态对齐产生了更强的潜在表示,转化为下游文本到音视频生成模型中更高的生成质量和改进的同步性。