NO/FOMO

每天一次,过滤 AI 噪音

值得打开的
AI 日报。

发布日期2026-07-10中文版本
本期阅读
—
累计阅读
—

AI Blog

2 stories
01

UST 与 Anthropic 合作,将 Claude 引入物理 AI 和硬件验证

Anthropic 与数字技术及工程服务提供商 UST 达成合作,将 Claude 模型集成到物理 AI 和硬件工程工作流中。在此次合作中,UST 部署了 Claude Code 以辅助工程师阅读硬件原理图、编写回归测试,并将现场设备性能与数字孪生进行对比。此外,UST 正在对 2 万名工程师、架构师和顾问进行 Claude 培训。Claude 已被整合进 UST 的 iDEC 平台,该平台目前已将芯片和硬件验证时间缩短了 50% 至 70%,旨在加速芯片设计并尽早发现物理系统缺陷。

02

德国电信与 OpenAI 合作构建 AI 原生电信系统

德国电信(Deutsche Telekom)宣布与 OpenAI 达成合作,将先进的 AI 模型集成到其电信业务和基础设施中。这项多年计划旨在变革关键运营领域,包括客户服务自动化、内部员工工作流和网络运营管理。通过部署 OpenAI 的生成模型,该公司寻求实现员工行政任务的自动化,并提高处理消费者咨询的速度和质量。此次合作符合德国电信向 AI 原生组织转型的更广泛战略路线图。

Hacker News

6 stories
01

GPT-5.6 Sol Ultra 成功证明“循环双覆盖猜想”

OpenAI 宣布其下一代模型 GPT-5.6 Sol Ultra 已成功生成了图论中长期悬而未决的“循环双覆盖猜想”(Cycle Double Cover Conjecture)的正式数学证明。该猜想断言每个无桥图都存在一组循环,能够恰好覆盖每条边两次。通过运用先进的推理能力、深层数学表征和符号逻辑,该模型展示了自主科学发现能力,而非单纯的辅助。这一里程碑标志着前沿 AI 系统在解决抽象理论问题方面的能力正在加速。

02

AI 生成视频助力精准刺激目标脑区

EPFL 的研究人员开发出一种利用 AI 生成视频的新方法,旨在精准定位并最大限度地刺激特定脑区。该项目结合了生成式 AI 模型与计算神经科学框架,构建出动态视觉刺激,以诱发目标视觉皮层区域的峰值神经活动。从静态图像刺激向动态输入的过渡,实现了更符合自然生物视觉处理的真实感。该方法对于高分辨率绘制大脑功能图谱及开发先进的脑机接口具有重要意义。

03

解析 JEPA (The Annotated JEPA)

Meta AI 研究部门由 Yann LeCun 领导提出了联合嵌入预测架构(JEPA)。本文通过技术解析详细介绍了该架构。与预测每个像素或 token 的传统生成式架构不同,JEPA 通过预测输入缺失部分的表征来学习模型。文章探讨了其底层数学原理、训练目标和结构组件,重点介绍了该模型如何利用基于能量的概念和非对比自监督学习来防止表征崩溃,同时捕捉语义特征。

04

Ask HN:有哪些任务是只有前沿模型才能完成的?

Hacker News 的一个技术讨论帖对比了开源权重 LLM 与顶级私有前沿模型的实际能力。用户分享了具体案例,旨在找出轻量级或开源模型(如 Qwen 和 DeepSeek)的短板,以及必须使用私有模型(如 Claude 3 Opus 和 GPT-4)的场景。讨论聚焦于具体的任务表现和调试细节,以评估当前 AI 部署策略的实际限制。

05

恐怖组织“博科圣地”如何使用前沿 AI

先进安全政策中心发布的一份报告调查了恐怖组织“博科圣地”(Boko Haram)如何应用前沿 AI 技术来优化其行动。报告详细描述了该组织如何利用大语言模型、生成式 AI 和高级数字工具进行宣传生成、战略规划和战术通信。这些工具降低了进行复杂数字活动的门槛,发挥了力量倍增器的作用,凸显了模型提供商执行严格对齐协议、安全性研究及主动监测的必要性。

06

LinkedIn“思想领袖”内容工厂背后的菲律宾虚拟助理

Rest of World 发表了一份调查报告,揭露了西方高管如何将其个人品牌和内容创作外包给菲律宾的虚拟助理。这些虚拟助理系统地使用结构化模板、算法优化和生成式 AI 工具来制作高参与度的 LinkedIn 帖文。调查揭示了现代职业“代笔”背后的机制,引发了关于数字平台真实性以及利用廉价远程劳动力和 AI 来操纵反馈算法的严重质疑。

Twitter

8 stories
01

OpenAI 发布具备增强代理能力的先进 GPT-5.6 模型

OpenAI 推出了 GPT-5.6,这是一款具备增强 token 效率和原生智能体能力的全新前沿模型,已直接部署在 ChatGPT 中。根据 Sam Altman 和微软的公告,该模型也被集成至 Microsoft 365 Copilot 作为其核心推理引擎。在基准测试中,Sol 变体模型在 ARC-AGI-3 测试中获得了 7.8% 的分数,标志着第一个在该评估套件中成功解决游戏的验证前沿模型诞生。

02

Claude Code 桌面端更新,集成应用内浏览功能

Anthropic 发布了 Claude Code 桌面工具的更新,引入了集成的、沙盒化的应用内浏览器,使 AI 智能体能够与外部文档和实时网站交互。此更新允许智能体在保护用户隐私的可配置持久性设置下浏览互联网资源。François Chollet 指出,这一更新是过去六个月智能体编程工具领域快速变革的一部分。

03

使用 Sol Ultra 解决五十年前的数学猜想

GPT-5.6 Sol Ultra 模型成功为一项五十年来未解的复杂数学猜想生成了正式证明。该模型利用并行测试时计算优化,从串行处理转向并行工作流,大幅降低了高层逻辑推理过程中的延迟。这一架构升级使得以往需要整天才能完成的复杂推理任务,如今仅需约一小时即可完成。

04

Ai2 发布用于高级文本和图像理解的 olmOCR 2

艾伦人工智能研究所(Ai2)推出了 olmOCR 2,这是一个在 Ai2 Playground 上部署的更新版开源模型套件。该模型套件针对高质量文本、视频和图像理解进行了优化,支持先进的多模态文档中心化视觉数据分析。通过提供开源访问,Ai2 旨在为研究人员和开发者推广先进的多模态 AI 工具。

05

MireloAI 与 Kyutai Labs 推出先进音频转 MIDI 模型

MireloAI 与 Kyutai Labs 联合推出了 Audio-to-MIDI 模型,旨在自动化音乐转录过程。该系统可从完整的音频录音中识别精确的音乐元素,并输出相应的数字 MIDI 记谱文件,从而简化创作者和音乐人的创作工作流。

06

Google AI Studio 为已部署应用推出自定义 URL

Google 为 Google AI Studio 推出了一项新功能,允许开发者为其已部署的应用配置自定义、永久的 URL。通过用个性化域名替换默认标识符,Google 旨在简化 AI 支持的 Web 应用在公开发布期间的托管、共享和品牌推广。

07

AI Picbreeder 引擎启动协作式多智能体进化系统

AI Picbreeder 引擎引入了一个由十个并行运行的视觉语言模型(VLM)培育智能体驱动的多智能体进化系统。该架构允许自主智能体进行协作、迭代采样,并在共享生态系统中进化复杂的数字资产,模拟人类创意设计工作流。

08

OpenAI 启动 Build Week 活动,提供开发者会议与挑战赛

OpenAI 宣布将于 7 月 13 日启动 Build Week,活动将包含为开发者社区设计的实时技术会议和项目挑战。该计划旨在通过促进协作项目提交和技术指导来支持开发者。作为筹备工作的一部分,OpenAI 还重置了 Codex 和 ChatGPT Work 级别的使用限制。

huggingface

8 stories
01

Vidu S1:一种实时交互式视频生成模型

我们推出了 Vidu S1,这是一款支持对数字角色进行语音控制的实时交互式视频生成模型。Vidu S1 基于 TurboDiffusion 和 TurboServe 构建,在普通消费级 GPU 上可输出高达 42 FPS 的 540p 实时视频。用户可随时通过语音指令控制视频生成内容,上传自定义图片并选择不同的语音音调。Vidu S1 支持无限长实时视频生成且无模糊、漂移或视觉失真,在所有测试指标中表现强劲,完全满足实时推理需求。

02

OpenCoF:通过视频生成学习推理

我们推出了 OpenCoF 框架,旨在研究和改进视频生成模型中的帧链(Chain-of-Frame, CoF)推理。OpenCoF 包含涵盖 11 个任务族的 OpenCoF-17K 推理视频数据集,以及经过微调的 Wan-CoF 视频模型。在四个视频推理基准测试中,Wan-CoF 较 Wan2.2-I2V-A14B 基准有显著提升。研究探讨了为模型配备视觉和文本推理 token 以捕捉底层线索和高层语义先验,证明了更强的视频推理需要广泛的时间监督和显式的中间状态组织。

03

UniClawBench:用于现实世界任务中主动智能体的通用基准

我们推出了 UniClawBench,这是一个旨在评估动态现实环境中主动智能体能力的基准测试。该基准围绕五种基础能力(技能使用、探索、长文本推理、多模态理解和跨平台协作)设计,包含 400 个双语现实任务,并在实时 Docker 容器中使用细粒度检查点进行评估。为了分离基础模型能力与框架选择,我们在多种智能体框架下评估了最先进的模型。我们还采用了一种包含执行者、监督者和用户智能体的闭环评估策略,以模拟逼真的多轮人类反馈。

04

UP:用于打破探索-稳定性困境的无界正向非对称优化

我们提出了无界正向非对称优化(UP),这是一种通用的即插即用优化目标,旨在解决大语言模型强化学习中的探索-稳定性困境。UP 通过停止梯度算子将策略锚定在当前状态来重组优化过程。该设计为正向优势释放了无截断、稳定的梯度以最大限度地提升探索能力,同时为负向优势保留了标准的截断保障。实验证明,UP 在多种强化学习算法(DAPO、GSPO、GRPO)、模型架构和训练模态中增强了探索能力并提升了推理准确性。

05

Flash-BoN:用于扩散模型推理时扩展的即时草图

我们提出了 Flash-BoN,这是一种用于文生图生成的推理时扩展策略,可加速最佳候选采样(Best-of-N, BoN)中的候选生成过程。Flash-BoN 通过结合时间步截断、层跳过和激活代理生成廉价的草图候选,随后进行多阶段验证以确定用于高质量优化的最佳草图。在三个基准和三种模型规模下,Flash-BoN 在固定时钟预算内始终优于引导搜索和标准 BoN,在更大模型规模上提升显著(+8% AUC),并能很好地集成基于反思的提示词优化(+16% AUC)。

06

CineMobile:用于电影级摄像机运动生成的端侧图生视频扩散模型

我们提出了 CineMobile,这是一个压缩的图生视频扩散框架,专为在移动设备上生成电影级摄像机运动而设计。CineMobile 利用蒸馏引导剪枝、扩散蒸馏、强化学习和混合后训练量化,将模型占用空间压缩至 1 GB 以下。CineMobile 较 Wan 2.1 教师架构实现了 40 倍加速。它在 H200 GPU 上单步延迟仅为 0.6 秒,在联发科天玑 8400 Ultimate 5G 上为 20 秒,可生成 49 帧 480p 视频,峰值内存占用仅 1.8 GB。

07

Jet-Long:利用动态双焦点 RoPE 实现高效长上下文扩展

我们提出了 Jet-Long,这是一种用于大语言模型的免训练零样本上下文扩展方法,它将局部 RoPE 忠实窗口与动态长程窗口相结合。通过利用包含-排除注意力合并和即时 RoPE 校正,Jet-Long 的单批次生成开销低于 4%。在最高 128K 上下文的 Qwen3 模型测试中,Jet-Long 在 RULER 基准上超过了最强基线,提升幅度达 4.79 个百分点,并在 HELMET-RAG 上获得领先准确率,同时在保持最低 PG-19 困惑度的同时泛化至 Jet-Nemotron 等混合架构。

08

CausalDS:评估数据科学智能体中的因果推理

我们推出了 CausalDS 基准,用于评估智能体数据科学工作流中的因果推理。每个实例均具有包含采样结构因果模型(SCM)、生成式观测数据和叙述性自然语言故事。基于经验分布以减少“因果模仿”风险,该基准测试涵盖了 Pearl 的三个层级。任务涉及使用多种工具处理不完整观测值的编码组件,在评估符号因果推理的同时,还考量了不确定性量化和弃权,即直接为识别出问题没有正确答案的情况评分。