NO/FOMO

Independent AI signal, once a day

The AI briefing worth opening.

ISSUE DATE2025-06-20DEFAULT EDITION
This issue
—
All time
—

Twitter

6 stories
01

gdb_OpenAI Codex日均合并万次PR,AI赋能软件工程

OpenAI联合创始人Greg Brockman引用Anjney Midha数据指出,OpenAI的Codex模型在过去35天内已在GitHub上合并了34.5万个拉取请求,平均每日高达1万个。这一惊人数字凸显了人工智能在软件工程领域日益增长的影响力,预示着AI正深刻改变软件开发模式,提升自动化水平和效率。

02

DeepLearningAI_苹果更新Foundation Models,提升设备端与服务器端AI性能

苹果公司更新了其Apple Foundation Models (AFM),推出设备端和服务器端新版本,旨在提升图像理解和多语言推理性能。同时发布了Foundation Models API,供开发者集成。设备端AFM采用3B参数Transformer,在某些任务上表现优于同类竞品;服务器端AFM采用混合专家架构,但与GPT-4o等顶级模型相比结果不一。

03

reach_vb_DeepMind发布Magenta实时音乐生成模型

DeepMind发布了Apache 2.0许可的Magenta实时音乐生成模型,该模型拥有超8亿参数,基于19万小时器乐训练,能通过2秒音频块实时生成音乐,并利用10秒上下文进行条件控制。它还引入了MusicCoCa联合音乐-文本嵌入模型,支持风格嵌入实现流派/乐器实时变形,且可在免费Colab TPU上实现1.25秒生成2秒音频,模型权重已在Hugging Face发布。

04

MiniMax__AI_发布突破性语音生成技术

MiniMax在“MiniMax周”活动中发布了名为“Audio Dessert”的语音生成技术,标志着语音设计领域的突破性进展。该技术允许用户通过任意提示词、任意音色和任意情感生成语音,并具备完全可定制和多语言支持能力,极大地提升了语音合成的灵活性和表现力,有望革新AI语音应用。

05

osanseviero_Google AI发布医疗AI模型MedGemma

Google AI开发者团队正式发布了MedGemma,这是一系列基于Gemma 3架构的变体模型,专为医疗文本和图像理解任务优化。MedGemma提供4B多模态模型和27B纯文本模型两种版本,旨在显著加速医疗健康领域的AI项目开发,为研究人员和开发者提供高效、专业的AI工具。

06

meshcapade_在CVPR2025展示数字人建模未来

Meshcapade在CVPR 2025大会上展示了其生产级数字人技术,揭示了人体建模的未来。该技术支持从图像和视频实时生成虚拟形象,并基于SMPL进行运动和形态估计,提供本地部署且隐私合规的解决方案。应用场景涵盖机器人、自动驾驶、人工智能及时尚领域。

GitHub

6 stories
01

Build a Large Language Model (From Scratch)

该GitHub仓库是《从零构建大型语言模型》一书的官方代码库,旨在指导用户从头开发、预训练和微调类GPT大语言模型。项目通过逐步编码,深入剖析LLM工作原理,并提供加载预训练模型权重进行微调的功能。其方法论与大型基础模型的构建方式相仿,且代码设计可在普通笔记本电脑上运行,无需专业硬件,适合教育和深入理解LLM的开发者。

02

AI Engineering Hub 🚀

“AI Engineering Hub”是一个专注于AI工程领域的GitHub仓库,旨在为开发者提供深入的教程和丰富的实践经验。它涵盖了大语言模型(LLMs)、检索增强生成(RAGs)以及AI智能体等前沿技术,通过实际应用案例帮助用户掌握并扩展AI工程技能。该项目致力于赋能不同水平的AI从业者,加速其在AI领域的学习与创新,是探索和实践AI工程的宝贵资源。

03

Claude Code

Claude Code是一款由Anthropic开发的智能编码工具,它作为终端智能体,能够理解整个代码库,并通过自然语言命令执行日常编码任务、解释复杂代码并管理Git工作流,从而显著提升开发效率。该工具支持在终端、IDE中使用,并可集成到GitHub平台,为开发者提供便捷、高效的AI辅助编程体验。

04

Gitingest

Gitingest是一个创新的工具,旨在将任意Git仓库内容转化为对大型语言模型(LLM)友好的文本摘要。它能够从Git仓库URL或本地目录生成代码上下文的文本摘要,并提供智能格式化、文件结构、提取大小和Token计数等统计信息。Gitingest支持作为命令行工具、Python包和浏览器扩展使用,极大地简化了LLM处理代码库的流程,提升了代码理解和分析的效率。

05

Web Development for Beginners - A Curriculum

微软云倡导者团队推出了一项为期12周的综合性Web开发课程,旨在教授JavaScript、CSS和HTML基础知识。该课程通过构建如虚拟生态缸、浏览器扩展和太空游戏等24个动手项目,结合测验、讨论和实践作业,采用项目式教学法,有效提升学习者的技能和知识留存。此外,该团队还发布了针对JavaScript的生成式AI新课程,进一步拓展学习领域。

06

n8n - Secure Workflow Automation for Technical Teams

n8n是一个面向技术团队的工作流自动化平台,融合了代码的灵活性与无代码的便捷性。它提供400+集成、原生AI能力(支持基于LangChain构建AI智能体工作流),并采用公平代码许可,允许用户完全控制数据和部署。n8n具备企业级特性,如高级权限、SSO和气隙部署,并通过活跃社区提供丰富的模板和支持,是构建强大自动化解决方案的理想选择。

wechat

6 stories
01

Andrej Karpathy最新演讲刷屏:软件 3.0 时代已经到来!

前OpenAI初始成员、前特斯拉AI总监Andrej Karpathy近期在Y Combinator的AI Startup School上发表了题为《Software in the era of AI》的演讲,引发广泛关注。他指出,AI时代正推动软件开发经历深刻的范式变革,预示着“软件3.0”时代的到来。此次演讲再次印证了Karpathy作为深度学习黄金时代塑造者的影响力,其观点对理解未来AI驱动的软件发展方向具有重要指导意义,并持续引发技术社区的深入讨论与思考。

02

Agentic AI时刻!多智能体驱动,「一人公司」这就要来了

文章指出,Agentic AI正迎来爆发时刻,其能独立感知环境、使用工具完成复杂任务,将AI从“问答”推向“执行”。亚马逊云科技在此领域提供全栈技术支持,包括Amazon Bedrock、Q Developer和Transform等,助力企业快速开发应用、实现代码现代化并大幅提升生产力。复星医药、合合信息等案例表明,Agentic AI在医学撰写、文档处理等知识密集型领域显著降本增效。该技术预示着“一人公司”模式的兴起,并有望重塑IT系统,亚马逊云科技已将其视为未来核心业务,加速推动AI创新与落地。

03

坏了!R1的秘密被Deepmind发现了!「啊哈时刻」首次被披露,现已可量化!

东京大学与Google DeepMind研究团队首次通过“推理图”可视化了DeepSeek-R1等推理模型的内部思考过程,揭示了其惊人智能背后的机制。研究发现,模型自我纠错的“啊哈时刻”在推理图中表现为清晰的环形结构,可量化为平均每个问题约5次“反悔”。推理图还显示,推理模型相比基础模型拥有更多环路、更大图直径及小世界特征,这些拓扑结构是其高效推理和错误修正的关键。此外,高质量训练数据能显著扩展推理图直径。这项研究为理解和改进AI推理能力提供了全新视角,预示着未来AI架构将基于智能的拓扑本质进行设计。

04

SIGGRAPH 2025|Large Avatar Model:单图秒级打造超写实3D交互数字人,跨平台超实时驱动渲染

阿里巴巴通义实验室提出大型头像模型LAM,旨在通过单张图像在秒级内生成可驱动的超写实3D高斯数字人。该模型突破传统方法对多视角数据和复杂后处理的依赖,采用规范化空间高斯球生成、多模态特征交互Transformer及网格细分等技术,实现轻量化、跨平台超实时驱动渲染,支持WebGL在移动端达到120FPS。LAM可直接兼容传统图形管线,无需神经后处理,并能结合大模型实现文本驱动生成和3D风格迁移。该技术已应用于构建低延迟、低成本的交互对话数字人解决方案,并已全面开源,为虚拟会议、游戏开发等领域提供新思路。

05

只改2行代码,RAG效率暴涨30%!多种任务适用,可扩展至百亿级数据规模应用

浙江大学与傅聪团队开源新方法PSP,通过仅修改两行代码,将RAG向量检索效率提升30%。该方法突破了最大内积检索的“度量错配”难题,证明了基于欧式距离构建的图索引结构,通过贪心算法可找到全局最优最大内积解。PSP还引入了自适应早停策略,显著提升搜索速度并减少冗余计算。该技术泛化性强,适用于多种模态任务,并展现出优异的可扩展性,有望应用于十亿乃至百亿级数据规模,为AI产品核心组件带来显著性能提升。

06

首个「万亿级时间点」预训练,清华发布生成式时序大模型日晷 | ICML Oral

清华大学发布生成式时序大模型“日晷”,其研究成果被ICML 2025接收为Oral论文。该模型首次实现万亿级时间点预训练,并构建了领域内最大的时序数据集TimeBench。日晷通过引入基于流匹配的预测损失函数,有效解决了时序预测的非确定性及模式坍塌问题,能够生成多条预测轨迹并提供概率预测能力。相较传统方法和现有深度模型,日晷在多项预测榜单上展现出卓越的零样本预测性能,且推理速度达到毫秒级,为多领域提供高效预测,有望扩展时序模型应用前景。

huggingface

4 stories
01

从跨领域视角再探LLM推理的强化学习

强化学习(RL)已成为改进大型语言模型(LLM)推理的一种有前景的方法,然而大多数公开研究工作狭隘地集中在数学和代码领域,这限制了我们对其在通用推理方面更广泛适用性的理解。一个关键挑战在于缺乏跨不同推理领域的可靠、可扩展的RL奖励信号。我们引入了Guru,这是一个精心策划的RL推理语料库,包含9.2万个可验证的示例,涵盖数学、代码、科学、逻辑、模拟和表格六个推理领域,每个领域都通过领域特定的奖励设计、去重和过滤构建,以确保RL训练的可靠性和有效性。基于Guru,我们系统地重新审视了LLM推理中RL的既有发现,并观察到跨领域的显著差异。例如,虽然先前的工作表明RL主要从预训练模型中激发现有知识,但我们的结果揭示了一种更细致的模式:在预训练期间经常出现的领域(数学、代码、科学)可以很容易地从跨领域RL训练中受益,而预训练暴露有限的领域(逻辑、模拟和表格)则需要领域内训练才能获得有意义的性能提升,这表明RL可能有助于真正的技能习得。最后,我们提出了Guru-7B和Guru-32B,这两个模型在公开可用数据RL训练的开放模型中取得了最先进的性能,在涵盖六个推理领域的17项任务评估套件中,分别比最佳基线高出7.9%和6.7%。我们还表明,我们的模型有效地提高了其基础模型的Pass@k性能,特别是在预训练数据中不太可能出现的复杂任务上。我们发布了数据、模型、训练和评估代码,以促进通用推理。

02

Show-o2:改进的原生统一多模态模型

本文介绍了改进的原生统一多模态模型Show-o2,该模型利用自回归建模和流匹配技术。Show-o2构建于一个3D因果变分自编码器空间之上,通过空间(-时间)融合的双路径构建统一的视觉表示,从而实现在图像和视频模态间的可扩展性,同时确保有效的多模态理解和生成。基于语言模型,自回归建模和流匹配分别原生应用于语言头和流头,以促进文本令牌预测和图像/视频生成。设计了两阶段训练方案,以有效学习并扩展到更大的模型。最终的Show-o2模型在处理包括文本、图像和视频在内的多种模态的广泛多模态理解和生成任务中展现出多功能性。代码和模型已在https://github.com/showlab/Show-o发布。

03

基于结构化指令的图表到代码生成迭代细化改进方法

近期,多模态大语言模型(MLLMs)因其强大的视觉理解能力而受到越来越多的研究关注。尽管它们在各种视觉任务上取得了令人瞩目的成果,但其在图表到代码生成方面的表现仍不尽理想。这项任务要求MLLMs生成可重现给定图表的可执行代码,这不仅需要精确的视觉理解,还需要将视觉元素准确地转换为结构化代码。直接提示MLLMs执行这项复杂任务通常会产生不令人满意的结果。为了解决这一挑战,我们提出了{ChartIR},一种基于结构化指令的迭代细化方法。首先,我们区分了两个任务:视觉理解和代码翻译。为了完成视觉理解部分,我们设计了两种类型的结构化指令:描述和差异。描述指令捕获参考图表的视觉元素,而差异指令则表征参考图表与生成图表之间的差异。这些指令有效地将视觉特征转换为语言表示,从而促进后续的代码翻译过程。其次,我们将整个图表生成流程分解为两个阶段:初始代码生成和迭代细化,从而实现最终输出的逐步增强。实验结果表明,与其他方法相比,我们的方法在开源模型Qwen2-VL和闭源模型GPT-4o上均取得了卓越的性能。

04

RE-IMAGINE:用于推理评估的符号基准合成

近期大型语言模型(LLMs)在推理基准测试中展现出高准确性。然而,目前尚不清楚观察到的结果是源于真正的推理能力,还是仅仅对训练集的统计性记忆。受因果关系阶梯(Pearl, 2009)及其三个层次(关联、干预和反事实)的启发,本文提出了RE-IMAGINE框架,旨在刻画LLMs推理能力的层次结构,并提供一个自动化流程,用于生成不同层次的问题变体。通过在中间符号表示中修改问题,RE-IMAGINE能够生成任意数量的、无法仅凭记忆解决的问题。此外,该框架具有通用性,可应用于数学、代码和逻辑等多种推理领域。我们通过在四个广泛使用的基准测试上演示该框架,评估了多个LLM家族,并观察到当模型面对问题变体时,其性能有所下降。这些评估结果表明,LLMs在过去的表现中一定程度上依赖于统计性记忆,并为进一步研究推理层次结构中的各项技能打开了大门。