GPT Rosalind增强了生物推理和生命科学研究能力
OpenAI宣布为其GPT-Rosalind模型引入新功能,以推进生命科学研究。更新后的模型具备更强的生物推理、药物化学专业知识和基因组学分析能力。此外,GPT-Rosalind引入了实验工作流功能,旨在帮助研究人员简化实验室和计算程序。此次更新旨在扩大大型语言模型在专业科学领域的使用范围,并为复杂的生物学挑战提供先进的智能支持。
每天一次,过滤 AI 噪音
OpenAI宣布为其GPT-Rosalind模型引入新功能,以推进生命科学研究。更新后的模型具备更强的生物推理、药物化学专业知识和基因组学分析能力。此外,GPT-Rosalind引入了实验工作流功能,旨在帮助研究人员简化实验室和计算程序。此次更新旨在扩大大型语言模型在专业科学领域的使用范围,并为复杂的生物学挑战提供先进的智能支持。
OpenAI为ChatGPT引入了一个新的记忆系统,旨在记住用户偏好并在不同对话中保持上下文。此功能使大型语言模型能够长期保留重要细节和用户指定的准则,消除了用户在每次新对话中重复信息的必要性。此次更新侧重于简化长期交互,并提高助手在重复任务和持续项目中的连续性辅助能力。
IT服务公司Endava正在其企业内部部署自主AI代理,以加速软件交付周期并自动化内部工作流。通过利用ChatGPT Enterprise和Codex,该公司正在构建一种AI原生组织文化,旨在提高开发人员的生产力。该集成侧重于部署代理工作流以处理复杂编程任务、辅助代码生成并优化交付管道,同时保持高水平的代码质量和安全性。
Wasmer利用由GPT-5.5驱动的OpenAI Codex,开发并构建了一个专为边缘环境定制的Node.js运行时。通过将该模型整合到开发工作流中,Wasmer成功地将其工程开发速度提高了10到20倍。这种效率提升使团队能够在几周而非几个月内发布完成的边缘运行时产品,凸显了专业生成式AI编码工具对软件开发的深远影响。
Andreessen Horowitz宣布了一系列全球计划,旨在促进与盟国的合作,并帮助成长型企业实现国际化扩张。前NSA和白宫官员Anne Neuberger加入公司担任普通合伙人兼全球事务主管,重点关注AI、机器人技术和国防现代化。此次对全球政策、国际市场进入战略及合作伙伴关系的整合,将投资组合的创始人与主权、机构和战略资本连接起来。
Andreessen Horowitz投资人Yoko Li详细阐述了视觉AI如何从像素原生生成转向代码原生生成。现代视觉AI工具不再通过扩散模型生成无法编辑的像素,而是越来越多地输出底层源代码,如SVG、HTML/CSS、React组件和Blender脚本。这种程序化表示形式使设计师、工程师和AI代理能够在生产工作流中持续迭代和编辑输出结果。
Anthropic发布了一份报告,详细说明了AI系统中递归自我改进的进展和安全边界。文档概述了当前大型语言模型在代码生成、强化学习反馈和自动化数据集管理中辅助优化后续迭代的技术路径。报告强调了为了负责任地管理自我改进系统并减轻智能爆炸风险所必需的安全协议、对齐挑战和评估框架。
Anthropic工程团队详细介绍了用于在产品环境中隔离和控制Claude的架构策略和安全边界。为了保护系统免受不可信输出和恶意代码执行攻击的影响,Anthropic采用了一个包含安全沙箱、微隔离和输入/输出清洗的控制流水线。这种安全基础设施使Claude能够在保持系统级安全的同时,自主运行代码并与工具进行交互。
一名独立研究人员进行了一项实验,花费1500美元的API费用来测试现代大型语言模型是否能自主发现并利用自定义Web应用程序中的漏洞。尽管基于LLM的自主代理能快速识别常见的漏洞模式,但在执行复杂的多步攻击和处理特定场景下的应用程序逻辑时表现吃力,证明了其在完全取代人类渗透测试人员方面的局限性。
两名Gem前工程师推出了Boxes.dev,这是一个纯云端的代理开发平台,旨在持久、专用的云容器中运行Claude Code和Codex代理。该服务旨在消除本地环境的局限性,如繁重的git工作树、并行测试时的资源限制以及对本地硬件的依赖,使开发人员能够持续运行并行AI编码代理,并从移动设备访问开发环境。
Two former Gem engineers launched Boxes.dev, a cloud-only agentic development platform designed to run Claude Code and Codex agents in persistent, dedicated cloud containers. The service aims to eliminate the limitations of localhost setups, such as heavy git worktrees, resource constraints during parallel testing, and local hardware dependency, enabling developers to run parallel AI coding agents continuously and access environments from mobile devices. (source: https://boxes.dev)
加州大学伯克利分校的教授报告称,本科计算机科学课程的不及格率急剧上升,并将此归因于学生在编程作业中对生成式AI工具的过度依赖,以及基础数学技能的退化。教职员工观察到,AI辅助阻碍了学生培养核心的调试和解决问题的能力,导致其在受控、无AI辅助的考试环境中表现糟糕。这一趋势促使教育者重新审视课程先决条件和考试方式。
Infracost的创作者推出了Cost.dev,这是一个旨在使自主编码代理具备成本意识的新命令行接口。该工具从底层重构以支持AI调用者,优化输出格式以最大程度减少Anthropic Claude等大模型的Token消耗。这使得代理能够高效评估拉取请求中的云基础设施成本影响,同时保持较低的LLM运营成本。
Nvidia发布了Nemotron 3 Ultra,这是一款强调极强能力效率比的开源权重大型语言模型。模型架构集成了Mamba-2-Attention混合堆栈和LatentMoE框架,在扩展性能的同时优化了计算效率。作为对之前Super变体参数大小的扩展,该版本旨在帮助开发者利用专门的注意力路由机制设计构建先进的生成式人工智能应用。
Sakana AI宣布了一项计划,旨在构建日本首个万亿参数的代理原生AI模型。该项目在经济产业省(METI)的GENIAC计划支持下,专注于开发专门为长跨度深度研究任务优化的自主系统。通过将模型参数扩展至此规模,该公司旨在改善日本国内AI生态系统中多步、自主的工作流。
Lindy已将其100%的生产级流量迁移至DeepSeek V4大型语言模型,取代了之前对Anthropic模型的依赖。该平台预计此举将节省数百万美元的基础设施开支。这一战略突显了企业界的一个普遍趋势:即通过基准测试专有模型,在不牺牲功能的前提下降低运营和推理开销。
Nvidia已将多教师在线策略蒸馏(Multi-Teacher, On-Policy Distillation)整合到其模型训练流水线中,以优化后训练过程。该方法通过利用多个教师模型来引导大型语言模型的微调和强化学习阶段,建立在DeepSeek R1等流行技术之上。行业观察者预计,这种蒸馏方法将为后续模型建立新的基准。
Runway报告称,其创意生成式AI平台在过去六周内企业采用率大幅增长。该公司记录了50%的Token消费增长,超级用户增长了140%,且净美元留存率飙升至300%。这些指标凸显了生成式视频合成在专业工作流中日益加深的集成。
Anthropic发布了内部数据,证明其Claude模型加速了AI开发工作流。调查结果表明,Claude目前的推理和编码能力为AI系统实现递归自我改进和增加自主性提供了可行路径。该数据集是评估现代语言模型如何促进自身进步和架构开发的一个里程碑。
吴恩达与Red Hat合作发布了一门关于高效服务大型语言模型的新课程。课程由Cedric Clyburn讲授,教授管理内存使用、优化KV缓存、量化模型以减少内存占用以及利用vLLM进行高性能并发部署的技术。
Greg Brockman宣布了ChatGPT记忆功能的重大增强,重点在于提高对话系统跨多个用户会话的上下文保留能力。此次更新旨在使交互历史的存储和检索更加稳健,减少用户重复指令的需要,并简化长期、多会话的工作流。
我们介绍了Cosmos 3,这是一个全模态世界模型系列,旨在在统一的Transformer混合架构内联合处理和生成语言、图像、视频、音频和动作序列。通过支持高度灵活的输入输出配置,Cosmos 3无缝统一了物理AI的关键模态——将视觉语言模型、视频生成器、世界模拟器和世界动作模型有效地整合到一个框架中。我们的评估表明,Cosmos 3在一系列理解和生成任务中建立了新的SOTA,证明了全模态世界模型作为具身智能代理可扩展的通用骨干。
我们提出了ThoughtFold,一个利用细粒度偏好学习来减轻冗余探索以提高推理效率的框架。ThoughtFold采用内省策略来识别每个正确轨迹中的冗余,从而产生一系列候选子轨迹。基于此频谱,我们引入了一种掩蔽偏好优化目标,明确惩罚冗余探索并鼓励模型直接桥接必要的推理片段,从而有效地将其推理链折叠为更简洁的路径。大量实验表明,ThoughtFold显著提高了效率。它在保持SOTA精度的同时,将DeepSeek-R1-Distill-Qwen-7B的Token使用量降低了约56%。
我们介绍了StreamMA,一个多代理推理系统,它在生成的瞬间将每个推理步骤流式传输给下游代理,通过流水线化相邻代理来减少延迟。令人惊讶的是,这种流水线处理也提高了有效性:由于多步推理质量参差不齐且早期步骤比后期步骤更可靠,使用这些可靠的早期步骤而非完整链条,防止了易出错的后期步骤误导下游代理。我们通过流式、串行和单一协议的首次闭式联合分析,推导出了有效性排序、加速上限和成本比率,形式化了这两种优势。
我们提出了Echo-Infinity,一种迈向实时无限视频生成的自回归(AR)框架,它采用可学习的演进记忆,以恒定成本动态过滤、抽象和压缩任意长度的历史。现有方法主要通过预定义的KV缓存调度、固定比例启发式压缩或推理时RoPE适应来管理记忆。这些设计由于缓存窗口有限且忽略了自回归生成噪声,必然会丢失历史信息并放大复合误差。受人类记忆巩固的启发,Echo-Infinity用可学习的记忆查询替换了手工设计的记忆整理,当过去帧被从本地窗口剔除时,这些查询通过注意力机制和门控机制进行更新。
为了解决这一差距,我们推出了AutoLab,一个用于超长跨度闭环优化的新基准。AutoLab包含36个现实、专家策划的任务,跨越四个不同领域:系统优化、谜题与挑战、模型开发和CUDA内核优化。每个任务都以一个正确但故意次优的基准开始,并挑战代理在严格的挂钟时间内对其进行改进。对17个SOTA模型的评估显示,成功的决定性预测因素不是代理初始尝试的质量,而是其在反复测试、编辑和整合经验反馈方面的毅力。
我们观察到社会规则在结构上类似于奖励函数。它们定义了可衡量的结果、阈值和例外情况,但往往只部分指定了制度意图。我们假设RL训练过程可能利用这些空白,因此探讨模型在RL过程中破解奖励函数的众所周知的倾向是否能演变为一种名为社会破解的更严重的失败模式:即发现社会运行规则中的漏洞。为研究此现象,我们引入了SocioHack,一个包含72个社会环境的沙箱,并发现这些环境中自然涌现出了奖励破解现象,导致了对监管漏洞的发现。
受弗里德里希·哈耶克市场中分散协调经济理论的启发,我们通过一个代理经济体研究了这一问题,在该经济体中,代理通过竞价争夺行动权、交换支付并从环境奖励中积累财富。这些简单的经济信号诱导了分散的信用分配,驱动了在没有全局编排或显式通信协议下的规划。群体通过经济选择演化:有效的代理积累财富并被变异用于探索,而无效的代理破产并被通过探索替代。我们展示了在以弱代理初始化的情况下,该经济体产生了涌现的多步推理策略。
本文介绍了Agent libOS,一种受库操作系统(Library-OS)启发的LLM代理运行时底座。Agent libOS运行在传统主机操作系统之上;它不实现硬件驱动、内核模式隔离或兼容POSIX的操作系统。相反,它将代理视为AgentProcess:一种具有进程身份、父子关系、生命周期状态、从AgentImage派生的工具表、类型化对象内存、显式能力、人类队列、检查点、事件和审计记录的可调度执行主体。其核心设计规则是工具类似于libc包装器;运行时原语即权限边界。