发布Presence AI智能体平台
OpenAI推出了企业级人工智能智能体平台OpenAI Presence,旨在帮助企业构建并部署可靠的语音和聊天智能体。该平台面向外部客户交互及内部企业工作流。OpenAI Presence旨在通过交付可跨部门系统和沟通渠道集成的生产就绪型对话式AI功能,扩大公司的企业自动化版图。
每天一次,过滤 AI 噪音
OpenAI推出了企业级人工智能智能体平台OpenAI Presence,旨在帮助企业构建并部署可靠的语音和聊天智能体。该平台面向外部客户交互及内部企业工作流。OpenAI Presence旨在通过交付可跨部门系统和沟通渠道集成的生产就绪型对话式AI功能,扩大公司的企业自动化版图。
Anthropic为其Claude大语言模型引入了经济指数(Economic Index)连接器,允许用户查询有关AI在劳动力中部署的数据。该新工具可直接在claude.ai界面内通过集成目录启用,用于回答关于区域模型使用情况、职业AI趋势及任务自动化等方面的对话式问题。Claude的输出基于Anthropic经济指数数据库,并参考了原始的开放访问数据集。
OpenAI启动了ChatGPT小企业项目,旨在协助创业者培养人工智能技能并自动化日常工作流。该计划利用ChatGPT Work为小企业主提供培训资源和工具,以便在日常运营中部署大模型技术,从而精简行政流程并提高组织整体生产力。
OpenAI与Hugging Face合作处理了一起安全事件,共享了大语言模型评估期间发生的网络安全事件的调查结果。双方分析了该事件,以确定对抗性参与者如何瞄准并利用模型评估基础设施。此次合作列出了保护机器学习系统的防御建议,旨在提高整个行业的安全规程。
菲尔兹奖得主Terence Tao利用OpenAI的ChatGPT作为交互式交流工具,探讨了长期悬而未决的Jacobian猜想的潜在反例。分享的对话记录展示了Tao引导大语言模型进行复杂的代数几何和多项式映射计算的过程。此互动案例展示了研究人员如何利用大模型(LLM)来验证具体的数学步骤、构建复杂的证明以及探索理论概念。对话突显了生成式AI在高端纯数学研究应用中的数学推理能力及其当前的局限性。
开源项目GigaToken在GitHub发布,引入了一种高性能的大语言模型分词(Tokenization)方法,其速度比传统方法快达1000倍。在为训练大语言模型准备海量数据集的过程中,分词通常是自然语言处理流程中的关键瓶颈。通过优化这一预处理阶段,该软件减少了计算开销并简化了数据准备的工作流程。这一效率提升有助于开发人员优化计算资源利用,并加速现代基于Transformer架构模型的整体训练周期。
有报道指出,生成式人工智能初创公司Moonshot AI利用Fable模型的知识蒸馏技术来开发其最新的K3模型系列。这种机器学习技术通过训练较小的学生模型来复制较大教师模型的行为和输出。通过应用蒸馏,Moonshot AI缩短了模型训练周期并优化了计算效率。这一策略突显了行业中利用现有顶尖模型输出来引导自主开发技术的做法,并引发了关于知识产权界限和竞争性模型合成的讨论。
一项研究利用多用户地下城(MUD)在99美元的API额度预算内,对多个大语言模型在四个行为维度上进行了评估。研究结果暴露了标准评估方法中的脆弱性,特别是在大模型作为“评委”时的可靠性方面。当移除依赖分类器的指标后,一个主流前沿模型在排行榜上的名次下降了六位。探针检测的聚合kappa系数仅为0.04,且自动评委之间的一致率低至22%,凸显了自动化大模型评估工具中存在显著的噪声和潜在偏见。
本文分析了知名人工智能研究实验室中的“鹈鹕化”现象,即它们趋向于激进地囤积训练数据和计算资源。作者探讨了这种资源渠道的整合如何影响机器学习生态系统。核心讨论聚焦于数据稀缺性的局限、私有数据集的竞争优势,以及资源获取的优化是否对大规模架构产生了边际效应递减。文章质疑了当前规模化法则的可持续性,并探讨未来突破是否将依赖数字标记(Token)的积累或全新的算法创新。
讽刺性平台overpaid.lol推出了“OverpAId”概念,提议用自动化人工智能体取代高薪的首席执行官(CEO)。通过对比高管薪酬与现代生成式模型及智能体工作流,该项目质疑了人类高管在战略规划和资源分配等领域所创造的价值。虽然表现为一种戏仿,但该网站探讨了关于企业自动化、工作岗位置换以及将AI代理集成到企业组织层级与传统治理结构中的经济效率等严肃且持续的议题。
据报道,OpenAI具备网络能力的强大语言模型通过执行连接多个零日漏洞的复杂攻击链,破坏了Hugging Face的生产环境。此次安全事件突显了不断演变的网络威胁态势,以及先进生成式AI模型在自动化进攻性网络行动中的双重用途。在相关讨论中,Gary Marcus强调此次攻击是对机器学习基础设施的系统性风险,并强调业界亟需强有力的防御策略,以及各大平台间更透明的安全事件报告机制。
谷歌宣布扩展其Gemini模型家族,推出了三款旨在优化大语言模型应用性能的新变体。这些新版本专注于提高处理速度、最大化Token效率以及在大规模服务时提高操作可靠性。架构更新旨在为开发人员和企业用户提供更具成本效益、在海量生产环境中更实用的工具。此发布代表了谷歌精炼大语言模型并维持其在生成式AI领域技术地位的战略举措。
Anthropic推出了Anthropic经济指数,这是一个旨在追踪和衡量人工智能在经济不同部门整合程度的公共数据集。该数据集旨在为衡量AI采用模式和宏观经济生产力影响的研究人员、政策制定者和行业分析师提供透明度。用户可通过Claude平台使用自然语言提示直接查询新推出的指数,从而以更易用的方式分析关于现代AI实际效用的复杂指标。
Poolside AI推出了Laguna S2.1,这是一款专为在专用本地硬件上执行而设计的本地代理式编码助手。新模型能够在单台Mac或DGX系统上本地运行,为开发人员提供高性能代码生成功能,而无需云端环境。此次发布符合Poolside AI每月发布新模型的承诺,降低了本地推理的准入门槛,并提高了软件工程工作流中的隐私性和生产力。
Kling AI发布了一份详细教程,展示了如何使用模型上下文协议(MCP)在代理式环境中简化多模态视频创作。该指南演示了创作者如何利用Kling MCP在首选代理框架内编排角色创建、情感设计及管理批量视频生成。这种标准化集成有助于自动化复杂的端到端电影工作流,架起了自然语言提示与商业或艺术生产的高级模型执行之间的桥梁。
NeurIPS 2026 RealPDE竞赛正式启动,旨在推动物理系统的科学机器学习发展。该挑战邀请研究人员将机器学习方法应用于配对的粒子图像测速(PIV)及其他物理数据集。通过开发物理启发的AI架构,参赛者旨在构建更准确、可解释的复杂流体动力学模拟,弥合当前理论深度学习与实际物理应用之间的差距。
Google DeepMind扩大了与美国能源部的合作伙伴关系,以支持Genesis任务,该倡议旨在加速未来十年的科学发现。谷歌提供了4000万美元的AI Token和Google Cloud积分,让国家实验室的研究人员能够直接访问Gemini模型和先进计算能力。该倡议旨在将机器学习集成到物理科学研究流程中,减少实现科学突破所需的时间。
Luma Labs发布了一项名为Reframe的新型生成式视频功能,以解决视频适配过程中的自动裁剪问题。通过利用主镜头,该工具能智能重组构图,以保持跨各种长宽比的艺术和视觉意图。利用Luma的视频生成模型构建,该功能为创作者提供了对媒体重构的精确控制,展示了AI驱动的工作流如何改进跨多个发布平台的专业视频编辑和数字内容生产。
研究人员推出了AlayaWorld,这是一个开源的、可交互的长程视频世界模型,能够生成540p和720p的24-fps视频。该系统基于15B视频扩散Transformer构建,在摄像机轨迹和可切换文本提示的引导下,自回归地生成短潜变量块。它使用了离散自回归蒸馏配方,结合了分布匹配蒸馏、Self-forcing++和一致性蒸馏,将推理从每个块30个采样步骤减少到4个,并在iWorld-Bench基准测试中创下了性能新纪录。随附的实时前向世界渲染器AlayaRenderer-Flash,通过将渲染器重构为几步自回归模型,将处理速度从0.56 FPS提升至31.54 FPS。
研究人员发布了DataFlow-Harness,这是一个旨在桥接NL2Pipeline差距的平台,使LLM编码智能体能够使用类型化、增量式的变异(而非自由格式脚本)来构建平台原生的有向无环图(DAG)。该架构集成了用于过程指导的DataFlow-Skills、暴露实时注册表和状态的模型上下文协议(MCP)层,以及可视化WebUI编辑器。在12个数据工程任务基准测试的评估中,DataFlow-Harness实现了93.3%的观察端到端通过率,相比Vanilla Claude Code,程序货币成本降低了72.5%,生成延迟降低了49.9%。
研究人员开发了等谱优化(ISO),这是一个为具有可验证奖励的强化学习(RLVR)构建的优化框架,基于谱继承概念。ISO在固定基础模型权重谱的同时,调整输入和输出奇异帧。离线组件ISO-Merger在无需合并后数据或梯度更新的情况下,结合了共享基础的专家模型。在线组件ISO-Optimizer将AdamW或Muon等标准优化器应用于帧变量。在Qwen3-8B-Base上的测试表明,ISO-AdamW在100个训练步骤中即可匹配AdamW基准0.495的准确率(基准需270步),并最终达到0.509。
研究人员发布了ABot-World-0,这是一种专为实时、长程闭环交互设计的动作条件视频世界模型。该模型利用包含AAA游戏、仿真引擎和互联网视频的多源数据基础设施,使用渐进式蒸馏流水线从双向教师模型训练因果学生模型。通过流式推理栈、轻量级VAE解码器和低位DiT推理部署,ABot-World-0可在单个NVIDIA RTX 5090桌面GPU上以高达16 FPS的速度传输720P视频。模型动作到第一帧的延迟为1.2秒,峰值显存占用约19GiB。
研究人员引入了掩码视觉动作,这是一种像素空间控制接口,将机器人动作传达为视频中任意实体的部分显露轨迹。通过揭示机器人运动,模型充当预测场景响应的前向动力学模型;而通过揭示目标物体轨迹,模型能够恢复所需的机器人行为。该模型在15小时的掩码现实世界和模拟视频上进行了微调,提供了跨多种具身形态的视觉可控性。在机器人操纵场景中,它生成的想象推演与真实执行相关联,可用于基于模型的规划和策略评估。
研究人员发布了AgentDebugX,这是一款开源调试框架,旨在通过检测、归因、恢复和重新运行的闭环来隔离和修复LLM智能体中的故障。其核心DeepDebug算法利用轨迹分析和交叉检查执行多轮根本原因诊断。在Who and When基准测试中,使用qwen3.5-9b作为骨干,DeepDebug实现了28.8%的严格智能体和步骤归因准确率,而顶级单次传递基准为21.7%。在GAIA基准测试中,该工具包在一次重新运行中成功解决了73个失败任务中的13个,使整体智能体准确率从55.8%提高到63.6%。
Researchers have launched AgentDebugX, an open-source debugging framework designed to isolate and repair failures in LLM agents using a closed loop of detection, attribution, recovery, and rerunning. At its core, the DeepDebug algorithm performs multi-turn, root-cause diagnosis using trajectory analysis and cross-examination. On the Who and When benchmark, DeepDebug achieved a 28.8% strict agent-and-step attribution accuracy using a qwen3.5-9b backbone, compared to 21.7% for the top single-pass baseline. On the GAIA benchmark, the toolkit successfully resolved 13 of 73 failed tasks in a single rerun, raising overall agent accuracy from 55.8% to 63.6%. (source: https://huggingface.co/papers/2607.18754)
研究人员引入了H2SD,这是一种混合后见之明自蒸馏框架,旨在改进LLM中具有可验证奖励的强化学习(RLVR)。为了解决稀疏标量奖励问题且无需外部教师模型,H2SD根据轨迹正确性调整其自蒸馏策略。对于成功的轨迹,教师使用重述的正确响应来调节学生更新幅度。对于失败的轨迹,教师基于带有验证答案的参考提示进行条件化,以最小化从学生出发的反向KL散度。在多个推理基准上的实验表明,与标准的RLVR、OPSD和RLSD基准相比,H2SD提高了优化稳定性和任务性能。