NO/FOMO

每天一次,过滤 AI 噪音

值得打开的
AI 日报。

发布日期2026-07-13中文版本
本期阅读
—
累计阅读
—

AI Blog

1 story
01

ChatGPT 入门指南

OpenAI 发布了一份教育指南,概述了使用 ChatGPT 的基本工作流和入门步骤。该文档引导新用户发起首次对话,并突出了在日常生产力、写作和头脑风暴中的实际应用。指南解释了如何将对话界面融入常规工作流,以辅助解决问题和执行创意任务。

Hacker News

8 stories
01

Grok CLI 将整个主目录上传到了 GCS

近日发生了一起重大的隐私和安全事件,据报道,Grok 命令行界面 (CLI) 在未经用户明确许可的情况下,将用户整个本地主目录上传到了 Google Cloud Storage。这一异常行为凸显了面向开发者的 AI 集成工具在自动化数据收集流程中存在的严重漏洞。安全分析师警告称,这种大范围的目录扫描风险可能会将敏感的本地凭据、个人文件以及私有 SSH 密钥暴露给云端平台。开发者社区对 AI 辅助编程工具中的数据处理方式和权限边界表示强烈担忧。

02

Zig 创建者直言不讳,Anthropic 夸大其词

Zed 文本编辑器创建者 Nathan Sobo 对 Anthropic 发起挑战,质疑当前 AI 编程助手实际能力与营销宣传之间的差距。争议的核心在于,现有的大型语言模型是否真正具备复杂推理能力的自主软件工程智能体,还是这些宣传过于夸大,未能兑现对开发者生产力的承诺。该评论批评了各大 AI 实验室为获取风险投资而过度夸大模型能力的现象。文章呼吁建立更诚实的基准测试,以评估模型如何融入实际工作流。这一话题在 Hacker News 上引发了广泛讨论,评论数超过 600 条。

03

Show HN: Clawk – 为编程智能体提供一次性 Linux 虚拟机,而不是你的笔记本电脑

Clawk 发布了一款开源安全工具,旨在为自主编程智能体在执行期间提供沙盒隔离。该工具不直接允许 AI 智能体在本地开发机器上运行命令,而是配置了一个一次性的、隔离的 Linux 虚拟机。这种隔离环境防止了在宿主操作系统上可能发生的损害、未经授权的文件访问或恶意代码执行。Clawk 桥接了本地智能体执行与安全虚拟化,让开发者能够在不冒本地凭据泄露风险的情况下,利用 AI 驱动的编程助手。

04

Show HN: Nobie – 一个供智能体与人类使用的 Excel 兼容运行时

Nobie 推出了一个与 Excel 兼容的运行时环境,旨在促进 AI 智能体与人类操作员之间的协作。通过利用基于电子表格的数据模型,该环境允许基于大模型的智能体使用标准 Excel 逻辑执行复杂的计算和结构化工作流。这种易于理解的界面使人类协作人员能够轻松审计、干预和引导智能体进程。该平台作为构建协作式“人在回路”系统的关键协调工具,可用于安全地扩展企业自动化。

05

Show HN: BillAI Bass,一款利用 Strands Agents 的 AI 驱动“大嘴比利鲈鱼”

开发者 Morgan Willis Cloud 发布了 BillAI Bass,这是一个开源硬件项目,将 Big Mouth Billy Bass(大嘴比利鲈鱼)电动玩具改装成了交互式 AI 助手。通过利用 Strands Agents,该系统将硬件的机械控制与实时生成的 AI 音频响应解耦并进行同步。架构处理自然语言输入,生成具备上下文意识的语音响应,并将音频频率转换为驱动鱼嘴和尾部动作的电机控制指令。

06

全新的 Grok 旗舰语音功能

xAI 发布了其全新的旗舰级 Grok Voices,为 Grok AI 平台引入了先进的语音合成功能。更新后的系统利用语音生成技术,提供了增强的情感范围、语速节奏以及逼真的人机语音交互体验。此次更新标志着 xAI 在多模态集成方面的进展,允许用户体验能够模拟自然人类语音语调的实时口头交互,从而实现大语言模型的直观、免提式使用。

07

前沿模型的真实价格。仅仅是 Tokens * 价格吗?

Playcode 的一项技术分析挑战了一种简单化的假设,即运行前沿模型的成本是“Tokens 乘以单价”的简单公式。报告指出,生产工作负载会产生隐藏的运营成本,包括提示词工程迭代、上下文窗口管理和延迟权衡。分析详细说明了架构决策、检索增强生成 (RAG) 设计和缓存利用如何极大地影响最终运营开销,要求开发者采取整体系统级的方法来优化大模型的预算。

08

潜空间作为一种新媒介

Kevin Kelly 发表了一篇文章,将“潜空间”概念化为一种由生成式 AI 技术实现的革命性数字媒介。通过将机器学习模型的多维数学空间视为可探索的领域,作者将潜空间定义为一个协作画布,而非单纯的数据库。用户不再只是简单地产生静态输出,而是在这个维度矩阵中导航和操纵以合成想法,这标志着我们在设计、艺术和数字表征方法上的转变。

Twitter

4 stories
01

Morpheus 基准测试引入非情境化持续学习环境

Francois Chollet 介绍了 Morpheus 基准测试的发布,这是一个专为持续强化学习研究设计的新框架。标准的强化学习基准测试通常依赖于无法捕捉现实部署复杂性的情境化、静态环境。Morpheus 通过提供不重置的持久模拟环境解决了这些局限性,要求智能体应对随时间持续演变的学习目标。这种方法旨在弥合实验室环境与动态现实世界之间的差距,为评估智能体的适应性提供了更稳健的方法论。

02

Kling AI 以电影级质量助力葡萄牙世界杯宣传片走红

Kling AI 宣布其生成式视频技术被制作公司 78 Films 用于制作葡萄牙的世界杯宣传片,该片已累计获得近 1 亿次观看。该商业项目采用了混合制作工作流,利用 Kling AI 的生成式视频模型制作出高保真、复杂的电影级场景,这些场景仅靠传统制作方法极难实现。此次部署为生成式 AI 视频工具在专业化、大规模媒体活动中的实际应用提供了重要的现实案例。

03

Kling AI 为生成式视频模型引入动态双角色功能

Kling AI 展示了一项新的产品功能演示,展现了其生成式视频模型中的角色转换能力。演示将一只家猫转换为一名职业拳击手,凸显了该平台在剧烈的物理和环境转换过程中,保持结构完整性、运动一致性和高保真纹理映射的能力。此更新旨在为内容创作者提供用于视频生成工作流中多模态角色动画和叙事一致性的精细工具。

04

OpenAI 团队庆祝 ChatGPT 性能里程碑式提升

Greg Brockman 宣布了 ChatGPT 在能力和性能方面取得显著提升的里程碑。这一内部开发标志着 OpenAI 团队的成功阶段,强调了已开始向用户推出的架构和系统功能更新。该里程碑反映了 OpenAI 迭代模型性能调优的持续战略,旨在为复杂工作流和创意工作提供更可靠、稳健且先进的对话界面。

huggingface

8 stories
01

Long-Horizon-Terminal-Bench:通过基于密集奖励的评分测试智能体在长周期终端任务中的极限

研究人员推出了 Long-Horizon-Terminal-Bench,这是一个包含九大类 46 项长周期任务的新基准,旨在评估 AI 智能体在扩展工作流中的表现。与仅依赖最终结果的传统终端基准不同,该框架将任务分解为细粒度的分级子任务,以提供密集的中间奖励信号。对 15 个前沿模型的评估显示,提升空间依然巨大:智能体在每项任务中平均消耗 990 万个 tokens,执行时长平均为 85.3 分钟。即使表现最好的模型,在 0.95 部分奖励阈值下的通过率仅为 15.2%,而在完美奖励阈值下仅为 10.9%。

02

一个用于德语和英语的主权开源基础模型

开发者发布了 Soofi S 30B-A3B,这是一个针对德语和英语的、主权开源的专家混合 (MoE) 混合 Mamba Transformer 基础模型。该模型在慕尼黑的德国工业 AI 云上构建,每个 token 仅激活 300 亿参数中的 30 亿,随着上下文增长,该模型保持近乎恒定的推理缓存。该模型在 27 万亿 token 上进行预训练,并加权了德语数据,其性能超过了其他欧洲主权基准,并在聚合基准测试中与 14B 到 27B 的密集模型相当。权重、中间检查点和训练代码均在宽松的开源条款下发布。

03

视频生成模型是通用视觉学习器

研究人员引入了 GenCeption 框架,证明了大规模文本转视频的生成式扩散模型可以作为通用计算机视觉任务的强力预训练骨干网络。在文本指令的引导下,GenCeption 利用这些生成式时空先验来执行前向感知任务,如深度估计、摄像机位姿估计和 3D 关键点预测。该模型在匹配或超越专用视觉架构的同时,所需的训练数据量比领先的基准少了 7 到 500 倍。此外,该系统展现了从合成人类训练视频到真实世界镜头及分布外物理物体的零样本泛化能力。

04

面向长上下文大模型的自导测试时训练

研究人员提出了一种名为自导测试时训练 (S-TTT) 的方法,旨在在不增加高昂计算成本的前提下,提升大语言模型对长上下文的利用率。虽然标准的测试时训练对噪声大、不相关的上下文片段敏感,但 S-TTT 指导模型在自适应之前识别相关的证据片段,将语言建模目标限制在这些目标区域内。在 LongBench-v2 和 LongBench-Pro 推理基准测试中,S-TTT 提升了 Qwen3-4B-Thinking-2507 和 Llama-3.1-8B-Instruct 的性能,准确率相对提升高达 15%。

05

面向语言智能的可扩展视觉预训练

研究人员展示了一项系统研究,证明在原始文档上进行视觉预训练是语言模型纯文本预训练的一种可扩展替代方案。该方法不再将图形、数学布局和页面结构等视觉丰富元素转换为纯文本,而是直接在文档图像上进行无监督视觉学习,无需提取文本。在多个骨干网络和基准测试中,直接在这些视觉文档表征上预训练的模型始终优于纯文本对应的模型,为通往视觉和语言智能提供了更完整的路径。

06

KronQ:通过 Kronecker 分解 Hessian 的大模型量化

研究人员引入了 KronQ,这是一个利用 Kronecker 分解 Hessian 近似将梯度协方差纳入量化流程的训练后量化 (PTQ) 框架。与 GPTQ 等平等对待输出通道的传统方法不同,KronQ 应用双向非相干处理来降低跨输入和输出维度的权重幅值方差,并结合了用于层间混合精度分配的灵敏度指标。在 LLaMA-3-70B 的 2-bit 仅权重量化中,GPTQ 会出现发散,而 KronQ 成功将模型压缩,在 WikiText-2 上达到了 7.93 的困惑度。

07

深入了解为什么大模型微调中记忆的知识无法泛化

研究人员分析了大模型中的“知行差距”,即模型成功记忆了微调后的事实,但无法将其应用于下游推理任务。利用一种称为“自修补”的创新激活干预技术,作者追踪了大模型内部新事实的空间动态,发现记忆的表征往往无法路由到计算有效的层。为了解决这种知识电路失调问题,他们开发了一种简单的启发式路由策略,在多个领域恢复了 58% 到 75% 的预言机泛化余量。

08

从 RGB 生成到密集场读取:文本转图像模型的像素级密集预测

研究人员开发了 ReChannel,这是一种在不使用目标端 RGB 解码器的情况下,将冻结的文本转图像扩散模型适配用于像素级密集预测的方法。通过一个极小的 33K 参数线性层,将扩散 Transformer (DiT) token 网格直接映射到局部像素级补丁,ReChannel 绕过了生成式输出接口,直接预测任务原生场,如深度和分割。通过 FLUX-Klein 评估,该系统在无需 Trimap 的抠图、KITTI 深度图和引用分割方面达到了最先进水平,执行速度比基于编辑的潜在解码等效方案快 2.48 倍。