NO/FOMO

Independent AI signal, once a day

The AI briefing worth opening.

ISSUE DATE2025-06-10DEFAULT EDITION
This issue
—
All time
—

Twitter

6 stories
01

OpenAI_o3-pro向Pro用户全面推出

OpenAI宣布其最新模型o3-pro已全面向所有ChatGPT Pro用户及API开发者推出。此次更新旨在提升用户体验和开发效率,进一步拓展AI应用场景。o3-pro的上线预计将为专业用户带来更强大的功能和更稳定的服务,巩固OpenAI在AI领域的领先地位。

02

ArtificialAnlys_OpenAI大幅下调o3模型价格

OpenAI宣布将其o3模型的定价大幅下调80%,使其在价格上与Gemini 2.5 Pro和Claude 4 Sonnet具有竞争力,并且比Claude 4 Opus便宜8倍。o3模型现在每百万输入/输出token的价格分别为2美元和8美元(此前为8美元和40美元),同时为缓存的输入token提供75%的折扣,显著提升了其市场竞争力。

03

MistralAI_发布首个推理模型Magistral

Mistral AI近日宣布推出其首个推理模型Magistral。该模型专为在特定领域、透明化以及多语言推理方面表现卓越而设计,旨在提供更高效、更可靠的AI推理能力。此次发布标志着Mistral AI在AI模型研发领域的新进展,有望在多个应用场景中发挥重要作用。

04

LangChainAI_Uber利用LangGraph构建AI开发代理实现代码修复

LangChainAI分享了Uber如何利用LangGraph框架构建AI开发代理的案例。这些智能体能够每天生成数千个代码修复方案,为5000名开发者提供服务,处理数亿行代码,并已累计节省超过21000小时的开发时间。这展示了AI在提升软件开发效率方面的巨大潜力。

05

Kling_ai_万鹏飞将在CVPR分享Kling视频生成模型

Kling AI宣布其视频生成模型负责人万鹏飞将在IEEE年度计算机视觉顶级会议CVPR上发表演讲。万鹏飞将带来题为“Kling介绍及我们迈向更强大视频生成模型的研究”的主题演讲,深入分享Kling在视频生成技术方面的最新突破和前沿进展。此次活动将于2025年6月11日9:00-17:00 (UTC-5)举行,旨在为学生、研究人员和行业专业人士提供价值。

06

summeryue0_Scale AI发布LLM红队测试与系统安全路线图

Scale AI的Summer Yue和Zifan (Sail) Wang共同发布了一份关于大型语言模型(LLM)红队测试的立场文件。该文件总结了迄今为止红队测试LLM的经验教训,探讨了关键问题、缺失环节以及模型安全如何融入更广泛的系统安全和监控体系。报告强调了红队测试前沿模型的研究重点,并提出了实现系统级安全和AI监控的路线图,旨在汇集不同视角,推动AI安全发展。

GitHub

5 stories
01

🌟 Awesome LLM Apps

该GitHub仓库“Awesome LLM Apps”汇集了大量基于RAG、AI智能体、多智能体团队、MCP及语音智能体等技术构建的LLM应用。它展示了如何利用OpenAI、Anthropic、Google及开源模型(如DeepSeek、Qwen、Llama)解决实际问题,涵盖从代码库到邮件处理等多样化场景。项目旨在提供实用且创新的LLM应用范例,推动大模型技术在不同领域的落地与发展,并鼓励社区贡献,共同构建丰富的开源LLM应用生态。

02

Boltz

Boltz是一个用于生物分子相互作用预测的模型家族,其中Boltz-2是最新一代基础模型,超越了AlphaFold3和Boltz-1,能够联合建模复杂结构和结合亲和力。它首次实现了接近基于物理的自由能微扰(FEP)方法的精度,同时速度提升1000倍,使得早期药物发现中的高通量虚拟筛选成为可能。Boltz模型及其代码在MIT许可下开源,可用于学术和商业用途。

03

✨ YouTube Transcript API ✨

YouTube Transcript API是一个Python库,用于获取YouTube视频的字幕和转录文本。它支持自动生成字幕和多语言翻译,无需依赖无头浏览器,显著提升了效率。该API还提供了处理IP封锁的代理功能、年龄限制视频的Cookie认证,并支持多种输出格式(如JSON、SRT),同时提供命令行工具,极大方便了开发者和用户获取和处理YouTube视频内容。

04

开源大模型食用指南

本项目是面向国内初学者的开源大模型教程,基于Linux平台,提供从环境配置、本地部署到高效微调的全流程指导。它简化了开源大模型的应用流程,涵盖LLaMA、ChatGLM、InternLM等主流模型,并指导命令行调用、在线Demo部署及LangChain集成。旨在帮助学生和研究者掌握开源大模型的“食用”方法,促进其在学习和实践中的普及应用。

05

MiniCPM

MiniCPM是一个极致高效的端侧大模型系列,由面壁智能、清华大学和中国人民大学联合开发。它通过创新的模型架构(如InfLLM v2稀疏注意力)、高效学习算法(如BitCPM三值量化)和优化推理系统(CPM.cu),实现了卓越的效率提升。MiniCPM系列模型在保持同等规模最优性能的同时,在典型端侧芯片上实现了5倍以上生成加速,并在工具调用、代码解释器、长文本处理等多个任务上超越同级别甚至更大参数量的模型,为端侧AI应用提供了强大的解决方案。

wechat

5 stories
01

英伟达港大联手革新视觉注意力机制!GSPN高分辨率生成加速超84倍

香港大学与英伟达联合推出广义空间传播网络(GSPN),革新视觉注意力机制。GSPN采用二维线性传播与“稳定性–上下文条件”,将高分辨率图像处理的计算复杂度从O(N²)或O(N)降至O(√N),同时完整保留空间连贯性。该技术在图像分类和生成任务中均实现效率与精度双提升,尤其在SD-XL模型中将16K×8K图像生成速度提升超84倍。GSPN无需位置嵌入且具备稳定性,展现出从学术到工业的巨大落地潜力,为多模态模型和实时视觉应用开辟新方向。

02

华为创造AI算力新纪录:万卡集群训练98%可用度,秒级恢复、分钟诊断

华为在AI算力领域取得突破性进展,通过构建“3+3”双维度技术体系,显著提升了万卡级AI集群的可用性、恢复速度及线性度。该体系包含全栈可观测、故障诊断、自愈容错三大基础能力,以及集群线性度优化、训练快速恢复、推理快速恢复三大业务支撑能力。华为实现了万卡集群训练可用度达98%,故障恢复最快秒级,诊断分钟级,线性度超95%,大幅提升了大模型训练与推理的效率和稳定性,解决了大规模AI应用中的关键挑战。

03

北大伯克利联手“拷问”大模型:最强Agent也才40分!新基准专治“不听话”的AI分析师

北京大学与加州大学伯克利分校联合发布IDA-Bench新基准,旨在模拟真实世界中迭代、探索性的数据分析场景,评估大模型Agent在多轮、动态指令下的表现。测试结果显示,即使是Claude-3.7和Gemini-2.5 Pro等顶尖模型,任务成功率也仅为40%,远低于预期。研究揭示,当前Agent在遵循指令与自主推理间难以平衡,常出现“过度自信”或“过度谨慎”等问题,导致任务失败。这表明,LLM Agent若要成为可靠的数据分析助手,仍需在理解、遵循和交互能力上进行重大改进。

04

让AI自己设计芯片!中国科学院发布「启蒙」,芯片全流程自动设计

中国科学院计算技术研究所联合软件研究所,发布了基于大模型等AI技术的处理器芯片和基础软件全自动设计系统「启蒙」。该系统能全自动完成芯片软硬件设计,部分或全面超越人类专家水平,已成功自动设计RISC-V CPU,性能达ARM Cortex A53。「启蒙」采用领域大模型、智能体和应用层三级架构,通过迭代演进解决数据稀缺、正确性与求解规模等挑战,有望大幅提升芯片设计效率,缩短周期,实现快速定制化,改变处理器芯片软硬件设计范式。

05

大模型是「躲在洞穴里」观察世界? 强化学习大佬「吹哨」提醒LLM致命缺点

加州大学伯克利分校强化学习专家Sergey Levine指出,当前大语言模型(LLM)并非直接从世界学习,而是通过分析互联网文本间接“扫描”人类思维的“投影”,如同柏拉图洞穴中的观察者。他认为LLM的成功源于对人类认知过程的“逆向工程”,而非真正理解世界或从经验中学习。Levine质疑LLM在物理世界理解和自主学习新技能方面的局限性,并提出未来AI发展需探索从物理经验中自主获取表征的新方法,以实现真正灵活、适应性强的智能,而非仅复制人类心智的“影子”。

huggingface

6 stories
01

强化预训练

在这项工作中,我们引入强化预训练(RPT)作为大语言模型和强化学习(RL)的一种新型扩展范式。具体而言,我们将下一个词元预测重构为一项使用强化学习训练的推理任务,通过正确预测给定上下文的下一个词元来获得可验证的奖励。RPT 提供了一种可扩展的方法,可以利用大量的文本数据进行通用强化学习,而无需依赖领域特定的标注答案。通过激励下一个词元推理能力,RPT 显著提高了预测下一个词元的语言模型准确性。此外,RPT 为进一步的强化微调提供了强大的预训练基础。扩展曲线表明,增加训练计算量持续提高了下一个词元预测的准确性。这些结果表明 RPT 是一种有效且有前景的扩展范式,可推动语言模型预训练的发展。

02

MiniCPM4:端侧设备上的超高效大语言模型

本文介绍了MiniCPM4,这是一种专为端侧设备设计的高效大语言模型(LLM)。我们通过在模型架构、训练数据、训练算法和推理系统这四个关键维度进行系统性创新,实现了这种高效率。具体而言,在模型架构方面,我们提出了InfLLM v2,这是一种可训练的稀疏注意力机制,可加速长上下文处理的预填充和解码阶段。在训练数据方面,我们提出了UltraClean,一种高效准确的预训练数据过滤和生成策略,以及UltraChat v2,一个全面的监督微调数据集。这些数据集使得模型仅使用8万亿训练tokens即可达到令人满意的性能。在训练算法方面,我们提出了ModelTunnel v2用于高效的预训练策略搜索,并通过引入用于负载均衡强化学习的chunk-wise rollout和数据高效的三元LLM BitCPM,改进了现有的后训练方法。在推理系统方面,我们提出了CPM.cu,它集成了稀疏注意力、模型量化和推测采样,以实现高效的预填充和解码。为了满足多样化的设备端需求,MiniCPM4提供了0.5B和8B参数的两个版本。充分的评估结果表明,MiniCPM4在多个基准测试中优于同等规模的开源模型,凸显了其效率和有效性。值得注意的是,MiniCPM4-8B在处理长序列时,相比Qwen3-8B展现出显著的速度提升。通过进一步的适配,MiniCPM4成功地支持了多种应用,包括可信赖的问卷生成和基于模型上下文协议的工具使用,清晰地展示了其广泛的可用性。

03

CyberV:视频理解中测试时扩展的控制论

当前的多模态大语言模型(MLLM)在理解长视频或复杂视频时可能面临挑战,这主要是由于测试时的计算需求、鲁棒性不足以及准确性有限,其根本原因在于其前馈处理的特性。对于参数量较少的模型,这些限制可能更为严重。为了解决这些问题,我们提出了一种受控制论原理启发的创新框架,将视频MLLM重新设计为能够在推理过程中进行自我监控、自我校正和动态资源分配的自适应系统。我们的方法CyberV引入了一个控制论循环,该循环由一个MLLM推理系统、一个传感器和一个控制器组成。具体而言,传感器监控MLLM的前向处理过程并收集中间解释,例如注意力漂移,然后控制器决定何时以及如何触发自我校正并生成反馈以指导下一轮处理。这种测试时自适应扩展框架无需重新训练或额外组件即可增强冻结的MLLM。实验表明,CyberV带来了显著的改进:在VideoMMMU数据集上,CyberV将Qwen2.5-VL-7B的性能提升了8.3%,将InternVL3-8B提升了5.5%,超越了具有竞争力的专有模型GPT-4o。当应用于Qwen2.5-VL-72B时,它带来了10.0%的提升,甚至达到了与人类专家相当的性能。此外,我们的方法在VideoMME和WorldSense等通用基准测试中也表现出持续的提升,这突显了其在使MLLM更鲁棒、更准确地进行动态视频理解方面的有效性和泛化能力。代码已在https://github.com/marinero4972/CyberV发布。

04

PolyVivid:基于跨模态交互与增强的生动多主体视频生成

尽管视频生成领域取得了最新进展,但现有模型仍缺乏细粒度控制能力,尤其是在多主体定制方面,难以保持一致的身份和交互。本文提出 PolyVivid,一个多主体视频定制框架,能够实现灵活且身份一致的生成。为了在主体图像和文本实体之间建立准确的对应关系,我们设计了一个基于 VLLM 的文本-图像融合模块,将视觉身份嵌入到文本空间中以实现精确的接地。为了进一步增强身份保持和主体交互,我们提出了一个基于 3D-RoPE 的增强模块,该模块支持文本和图像嵌入之间的结构化双向融合。此外,我们开发了一个注意力继承的身份注入模块,以有效地将融合后的身份特征注入到视频生成过程中,从而减轻身份漂移。最后,我们构建了一个基于 MLLM 的数据管道,该管道结合了基于 MLLM 的接地、分割和基于团的主体整合策略,以生成高质量的多主体数据,有效增强主体区分度并减少下游视频生成中的歧义。大量实验表明,PolyVivid 在身份保真度、视频真实感和主体对齐方面取得了卓越性能,优于现有的开源和商业基线。

05

GUI-Reflection:赋能多模态GUI模型自反思能力

多模态大语言模型(MLLMs)在革新图形用户界面(GUI)自动化方面展现出巨大潜力。然而,现有的GUI模型大多依赖于从几乎无错误的离线轨迹中学习,因此缺乏反思和错误恢复能力。为了弥补这一差距,我们提出了GUI-Reflection,这是一个新颖的框架,通过专门的训练阶段(GUI特定预训练、离线监督微调(SFT)和在线反思调优),将自反思和错误纠正能力明确地整合到端到端的多模态GUI模型中。GUI-Reflection通过全自动数据生成和学习过程实现自反思行为的出现,无需任何人工标注。具体而言,1)我们首先提出了可扩展的数据管道,以从现有成功轨迹中自动构建反思和错误纠正数据。虽然现有GUI模型主要关注接地和UI理解能力,但我们提出了GUI-Reflection任务套件,以明确学习和评估面向反思的能力。2)此外,我们为移动设备上的GUI模型的在线训练和数据收集构建了一个多样化且高效的环境。3)我们还提出了一种利用所提环境的迭代在线反思调优算法,使模型能够持续增强其反思和错误纠正能力。我们的框架为GUI智能体配备了自反思和纠正能力,为更鲁棒、适应性更强、更智能的GUI自动化铺平了道路,所有数据、模型、环境和工具都将公开发布。

06

SAFEFLOW:一种可信赖且事务性的自主智能体系统原则性协议

大型语言模型(LLM)和视觉-语言模型(VLM)的最新进展使得强大的自主智能体能够进行复杂的推理和多模态工具使用。尽管其能力日益增强,但当前的智能体框架仍然脆弱,缺乏安全信息流、可靠性和多智能体协调的原则性机制。在这项工作中,我们引入了SAFEFLOW,一个用于构建可信赖的基于LLM/VLM智能体的新型协议级框架。SAFEFLOW强制执行细粒度信息流控制(IFC),精确跟踪智能体、工具、用户和环境之间所有交换数据的来源、完整性和机密性。通过限制LLM推理以遵守这些安全标签,SAFEFLOW防止不受信任或对抗性输入污染高完整性决策。为确保并发多智能体设置中的鲁棒性,SAFEFLOW引入了事务性执行、冲突解决和共享状态上的安全调度,从而保持智能体间的全局一致性。我们进一步引入了包括预写日志、回滚和安全缓存等机制,以进一步增强对运行时错误和策略违规的弹性。为了验证性能,我们构建了SAFEFLOWBENCH,一个全面的基准测试套件,旨在评估智能体在对抗性、噪声和并发操作条件下的可靠性。大量实验表明,使用SAFEFLOW构建的智能体即使在恶意环境中也能保持出色的任务性能和安全保障,显著优于现有技术。SAFEFLOW和SAFEFLOWBENCH共同为原则性、鲁棒和安全的智能体生态系统奠定了基础,推动了可靠自主性的前沿发展。