NO/FOMO

每天一次,过滤 AI 噪音

值得打开的
AI 日报。

发布日期2026-06-01中文版本
本期阅读
—
累计阅读
—

Hacker News

6 stories
01

CS336:从零开始构建语言模型

CS336:从零开始构建语言模型是斯坦福大学的一门综合性学术课程,专注于从头开始构建和理解大语言模型。课程引导学生掌握现代语言建模的基本机制,详细介绍了数学基础和架构组件(如 Transformer)。学生通过实现分词、自注意力机制和优化技术等关键步骤获得实战经验。课程还探讨了大规模数据集所需的训练动态、缩放定律和高效分布式训练方法。此外,课程涵盖了模型评估以及监督微调和人类反馈强化学习等微调策略。通过揭开从数据预处理到部署的整个流程,CS336 为致力于掌握当代生成式 AI 系统工程原理的学生和研究人员提供了扎实的技术基础。

02

一台十年前的 Xeon 处理器就足够了

本文探讨了在十年高龄且易于获取的硬件上运行现代大语言模型(特别是 Google 的 Gemma)的可行性和性能。作者使用 2016 年时代的 Intel Xeon 处理器证明,消费级旧服务器硬件在执行本地 AI 推理任务方面依然具有出色的能力。这一方法挑战了行业内“现代生成式 AI 工作负载必须依赖昂贵尖端 GPU 集群”的传统观点。通过软件优化、量化模型权重以及 llama.cpp 等优化推理引擎,老旧的 CPU 架构也能实现可用的 token 生成速度。这些研究结果为希望尝试本地 AI 模型但又不想投资昂贵现代加速器的爱好者、研究人员和开发人员提供了一个高性价比且可持续的选择。这种自托管方案凸显了 AI 技术的民主化,证明了软件层面的效率提升可以让老旧的企业级硬件在现代自然语言处理应用中焕发新生。

03

Qwen3.7-Plus:多模态智能体

阿里巴巴通义千问团队推出了 Qwen3.7-Plus,这是一项针对多模态智能体进行高度优化的先进模型。该模型通过结合强大的视觉、听觉和文本理解能力以及主动决策能力,实现了重大跨越。Qwen3.7-Plus 专为赋能复杂的 AI 智能体而设计,在需要感知丰富多模态输入、对复杂任务进行推理并执行精确动作的动态环境中表现出色。通过弥合感知与行动之间的差距,该模型支持无缝工具集成、复杂的逻辑规划和实时环境交互。它的发布凸显了行业向智能体工作流和交互式系统的转变,这些系统能够跨不同软件接口自主运行,为实际场景中的多模态 LLM 应用设立了新基准。

04

斯坦福 CS336 课程 AI 智能体指南

本文档概述了在斯坦福大学 CS336 课程中集成 AI 智能体的操作指南。指南专注于 AI 助手的实际应用,确立了学生和开发人员在作业中应遵循的最佳实践,重点在于代码结构、测试和格式标准。指南明确了代码编译、静态检查和系统化执行测试套件的指令,以确保智能体生成的代码符合学术严谨性。通过规范这些交互,该材料为在深度学习教育环境中将 Claude 等大语言模型智能体用作“副驾驶”提供了结构化框架。它凸显了教育机构如何适应自动化的编码工作流,强调了标准化环境配置、严格的测试协议以及学生机器学习项目中稳健的错误处理机制。

05

从零构建基础 AI 智能体:工具篇

本技术指南提供了从零开始构建基础人工智能体的全面分步演练,重点在于工具集成。文章详细介绍了如何为大语言模型配备外部能力,使其能够与 API 交互、执行计算并获取实时数据以解决复杂任务。通过解释工具定义、函数调用和执行循环的底层机制,本文揭开了现代 AI 系统如何从被动文本生成器转变为主动问题解决实体的面纱。开发人员将学习如何设计、编写并将自定义工具集成到智能体工作流中,从而提升模型的整体效用和推理能力。最终,本指南为理解智能体架构提供了实践基础,表明稳健的 AI 智能体可以在最小依赖条件下,通过清晰的提示词工程和结构化 JSON 输出进行构建。

06

Visa 投资 Replit,助力开发者构建智能体支付

Visa 宣布对云端软件开发平台 Replit 进行战略投资,旨在加速将交易功能集成到 AI 开发工作流中。此次合作旨在开创“智能体支付”概念,使开发者设计的自主 AI 智能体能够安全、无缝地执行金融交易。通过将 Visa 的大规模支付网络基础设施直接嵌入 Replit 的编码环境,此次合作降低了软件工程师创建金融应用的门槛。开发者将能够访问专业工具和 API,以编写能够管理预算、处理支付并自主执行复杂金融微交易的智能体。此次里程碑式的投资凸显了金融科技与人工智能日益交融的趋势,展示了未来 AI 系统不仅能生成代码,还能在法律和技术上安全地处理现实世界的经济交换。

Twitter

6 stories
01

fchollet_ARC-AGI-3 SOTA

这条推文强调了人工智能领域的重大进展,特别是在 ARC-AGI-3 基准测试方面。报告指出,Anthropic 的 Opus 4.8 模型在 ARC-AGI-3 任务中达到了新的最先进(SOTA)性能水平。凭借 1.5% 的基准分数和约 10,000 美元的奖金,这一里程碑凸显了模型在复杂环境中进行抽象推理和问题解决能力的持续演进。分析表明,Opus 4.8 在测试过程中展现了读取和解释环境参数的独特能力。这一成就为旨在推动通用智能和算法效率边界的研究人员提供了技术基准,反映了当前评估先进大规模语言和推理模型时采用的严谨学术与竞争标准。

02

ylecun_LLM 与 JEPA 模型对比

Yann LeCun 强调了当前人工智能研究中一个根本性的架构区别,对比了大语言模型(LLM)与联合嵌入预测架构(JEPA)。其核心论点在于学习机制:LLM 通过离散 token 的统计预测获取智能,而 JEPA 和 data2vec 等模型则通过预测抽象表征来运作。这种向预测潜空间抽象的转变被提议作为实现更稳健世界模型的潜在路径。通过跳过 token 级预测转向概念抽象,这些架构旨在建立对环境更细致的理解。这一技术对比凸显了行业内关于自回归缩放局限性的争论,以及在追求先进机器智能过程中,基于抽象的学习范式所具有的潜在优势。

03

c_valenzuelab_Runway 英国总部

领先的生成式 AI 视频研究与产品公司 Runway 正式宣布在英国建立其新的欧洲总部。这一扩张得到了 2 亿美元的重大投资支持,旨在推进世界模型人工智能的研究与开发。该计划旨在加强区域 AI 生态系统,并在英国市场创造大量高技能技术岗位。通过扩大在欧洲的业务版图,Runway 旨在加速其创新多模态创意工具的部署,并推进其构建复杂世界模型的长期战略使命。此公告标志着国际 AI 基础设施发展的关键时刻,彰显了 Runway 通过与区域合作伙伴及政策制定者的合作,致力于全球增长并持续推动专业化 AI 研究倡议的承诺。

04

natolambert_Nvidia 开放 AI

Nvidia 在推动美国开放模型计划方面发挥着核心作用,是技术快速演进的关键驱动力。推文强调,一个拥有 550B 参数的超大模型发布是一个重要的转折点,迫使更广泛的受众关注行业向开源可访问性的转变。此外,作者强调,除了模型的计算能力之外,高质量、有价值的训练数据集的发布也是生态系统中常被忽视但至关重要的贡献。这一进展标志着开放 AI 领域的成熟,基础设施提供商(如 Nvidia)与模型贡献者正协作推动大规模生成架构在开源研发周期中所能实现的边界。

05

AndrewYNg_AI 就业趋势

吴恩达(Andrew Ng)讨论了 AI 领域“前线部署工程师”(Forward Deployed Engineer,FDE)职位的兴起,这是一个由 Palantir 推广的嵌入式职位,帮助客户将 LLM 集成到自定义的智能体工作流中。虽然 FDE 在 OpenAI 和 Anthropic 等公司受到重视,但吴恩达认为,更广泛的需求依然集中在利用 LLM 提示词和智能体框架构建软件应用的通用 AI 工程师身上。他指出,相比单一供应商的深度绑定,公司往往优先考虑供应商中立的选择性。吴恩达预计 AI 工程领域最终将细分为 LLMOps、评估(Evals)和 AI 数据工程等专业角色,类似于传统软件工程的历史演进。最终,他强调了市场对能够驾驭成熟 AI 景观的熟练专业人员的需求不断增长,推动了整个技术领域的长期就业增长。

06

LumaLabsAI_AI VFX 变革

LumaLabsAI 最近强调了人工智能集成对视觉特效(VFX)行业的变革性影响。通过转发 DreamLabLA 的内容,该公司强调了从手动像素级编辑到更直观的“结果导向”指挥流程的演变。技术演示展示了现代 AI 模型如何实现复杂的合成和渲染任务自动化,显著简化了生产工作流。这种转变预示着对创意行业的深远影响,即 AI 驱动的工具执行复杂的日常技术操作,使艺术家能够专注于高层次的创意构思。随着生成式 AI 的持续成熟,它在视频制作中的作用变得日益复杂,有望在未来缓解传统的渲染瓶颈。这一进展标志着深度学习与专业级媒体创作融合的重要里程碑,为视觉内容制作的效率和创意潜力设定了新基准。

huggingface

6 stories
01

Mellum 2 技术报告

我们推出了 Mellum 2,这是一个开源权重、12B 参数的混合专家(MoE)语言模型,每个 token 激活 2.5B 参数。Mellum 2 是一个专精于软件工程的通用语言模型,涵盖代码生成、编辑、调试、多步推理、工具使用、函数调用、智能体编码及对话式编程辅助,是 Mellum 4B 密集模型的继任者。该架构基于混合专家设计(64 个专家,8 个激活),结合了分组查询注意力(GQA)与 4 个 KV 头,每 4 层中有 3 层采用滑动窗口注意力,以及一个兼作预训练辅助目标和推测解码草稿模型的单 token 预测头。每项设计均通过在商品 GPU 上的推理效率约束进行了消融验证。预训练包含约 10.6 万亿 tokens,采用三阶段课程,逐步将混合数据从多样化网络数据转向精选代码和数学内容,并使用 FP8 混合精度的 Muon 优化器进行训练。通过层选择性 YaRN 技术扩展至 128K 上下文窗口,随后在两个阶段进行后训练(监督微调后进行 RLVR),发布了两个版本:直接回答的 Instruct 模型和在最终答案前输出显式推理轨迹的 Thinking 模型。在代码生成、数学推理、工具使用、知识和安全性基准上,Mellum 2 与 4B-14B 范围内的开源模型竞争,运行效率相当于 2.5B 密集模型。我们在 Apache 2.0 协议下开源了基础模型、Instruct 和 Thinking 检查点。

02

SCOPE:通过协同演化策略进行开放式任务的自我博弈

自我博弈可以在无需外部监督的情况下训练语言模型。然而,现有方法需要可规则检查的答案,使得开放式任务仍依赖于精选提示词或前沿模型作为评判。我们引入了 SCOPE,这是一个针对开放式任务的无数据自我博弈框架,它协同演化两种策略:生成文档导向任务的“挑战者”和通过多轮检索回答任务的“解题者”。初始模型的冻结副本充当自评判,从源文档编写特定任务的评分标准并根据这些标准评估解题者的回答。在三个 7-8B 指令微调模型(Qwen2.5, Qwen3, OLMo-3)上的实验表明,SCOPE 在 8 个基准测试中将开放式任务性能提升了多达 10.4 分,并匹配或超过了基于约 9000 条精选提示词训练的 GRPO_data。尽管仅在开放式任务上训练,SCOPE 在 7 个短文本问答基准上也提升了多达 13.8 分,在所有三个模型上都超越了 GRPO_data。消融实验显示,协同演化挑战者对于维持任务难度是必要的,性能提升源于检索和合成能力的双重改善,而评分标准的生成质量是自评判的关键瓶颈。

03

DecMem:利用解耦内存实现分钟级一致性世界生成

视频生成模型的最新进展推动了可控世界模型的快速发展。然而,在长视距推理下保持细粒度的时空一致性仍是一个关键挑战。在这项工作中,我们超越了显式 3D 内存和粗糙的帧级隐式建模,提出了一种细粒度、可学习且可扩展的内存架构,用于生成一致的世界。我们首先确定了朴素可学习内存架构在长视距外推中的两个基本限制:计算效率低和注意力分散。通过对注意力分散的系统分析,我们提出了 DecMem,这是一种解耦内存架构,它采用稀疏全局内存进行高效的细粒度历史访问,并使用锚定局部内存进行稳定高质量的外推。大量实验表明,DecMem 显著优于当前最先进的方法。通过确保精确高效的长效内存并实现卓越的外推能力,DecMem 实现了高保真、一致性强的分钟级可控长视频生成。

04

SAAS:用于智能体搜索中过度搜索抑制的自感知强化学习

智能体搜索使大语言模型能够通过迭代推理和外部搜索解决复杂的多跳问题。尽管效果显著,但这些系统在实践中往往存在严重缺陷:智能体无法识别自身的知识边界,在内部知识足以应对时盲目触发搜索,或者即使已收集到足够证据也无法终止搜索。缺乏这种自感知会导致严重的“过度搜索”,产生显著的推理延迟和高昂的计算成本。为此,我们提出了 SAAS,一种新颖的强化学习框架,旨在培养动态自感知能力,在不影响准确性的前提下精确调节搜索行为。SAAS 包含三个关键组件:(i) 搜索边界建模机制,通过对比搜索禁用和搜索启用的路径来识别演化策略下的搜索边界;(ii) 边界感知奖励模块,将这种边界感知转化为轨迹级惩罚,抑制不必要的搜索;(iii) 分阶段优化策略,利用课程学习优先考虑推理而非搜索正则化,从而避免奖励欺骗。大量实验表明,SAAS 在保持准确性的同时大幅减少了过度搜索。代码已开源:https://github.com/XMUDeepLIT/SAAS。

05

从模型缩放到系统缩放:智能体 AI 中的 Harness 缩放

本文研究了智能体 AI 的下一个重大瓶颈——系统缩放,而非仅仅是模型缩放:即在基础模型周围设计可审计、持久、模块化和可验证的架构。我们称这种范式转变为“缩放 Harness”:将基础模型周围的结构化执行层视为设计、评估和优化的首要对象。尽管最近的大语言模型使智能体能够使用工具、检索信息、维持内存和执行长视距工作流,但评估仍然主要以模型为中心,通常将智能体简化为最终任务的成功,而将内存、检索、工具使用、编排、验证和治理作为次要细节。这种框架越来越不适用,因为智能体性能源于基础模型、内存基底、上下文构建器、技能路由层、编排循环和验证与治理层之间的相互作用。这些组件共同构成了“智能体 Harness”,它将模型能力转化为长视距智能体行为。我们研究了通过上下文治理、可信内存和动态技能路由这三个核心瓶颈来缩放 Harness,并讨论了协调和约束它们的编排与治理机制。我们进一步列出了 Harness 级基准的研究议程,以超越单次任务成功,测量轨迹质量、内存卫生、上下文效率、通信保真度、验证成本和随时间的安全演化。为了使讨论具体化,我们开发了 CheetahClaws(https://github.com/SafeRL-Lab/cheetahclaws),这是一个 Python 原生参考 Harness,并将其与 Claude Code 和 OpenClaw 进行了对比。我们的主要观点是,智能体 AI 的未来进展将取决于系统设计,正如其取决于更强大的基础模型一样。

06

RLHF 的另一面:用于奖励模型自监督改进的策略内反馈

为语言模型对齐构建强大的奖励模型(RM)受限于从人类标注或评判模型获取多样化、可靠偏好数据的成本和难度。随着策略演化超越静态 RM 训练,这一问题愈发严重。因此,我们提出了 SAVE(通过价值锚定策略内反馈进行自监督奖励模型改进),该框架利用值函数对策略内反馈进行评估,从而对策略内回复进行打分以用于 RM 训练。SAVE 自然地将经奖励分级的策略内回复转化为具有特定提示值头的监督信号,作为自适应锚点。它计算 RM 优势并过滤模糊样本,通过对比目标更新 RM。SAVE 在 6 个不同基准上的严格实证评估证实了其增强 RM 训练的有效性。它在所有数据集上取得了领先结果,并在三种 RL 算法(GRPO, RLOO, GSPO)和不同的策略基座上保持了一致的性能提升。