--digest

POCHE DIGEST

Google DeepMind 发布 Gemini Robotics 2 具身智能模型系列

Google DeepMind 推出新一代物理 AI 模型 Gemini Robotics 2,旨在为人形机器人提供全身控制能力与复杂手部灵巧操作。该系列包含三大核心模型:负责人形机器人全身体控制与精细抓取的 Gemini Robotics 2、具备真实世界视频理解与多步规划能力的 Gemini Robotics ER 2,以及支持本地运行并在数小时内适配新硬件的 On-Device 2。

此外,新系统还引入了多机器人协同机制,使不同形态的机器人能够通信协作。DeepMind 在示范中展示了 Apollo 2 机器人根据单一指令弯腰抓取水壶,以及控制五指机械手完成打结与拧螺丝等高难度动作。

OpenAI 揭示开启两项 API 设置让 GPT-5.6 Sol 的 ARC-AGI-3 得分提升三倍

OpenAI 发布技术报告,解释了其推理模型 GPT-5.6 Sol 在 ARC-AGI-3 2D 谜题基准测试中得分从 13.3% 暴涨至 38.3% 的原因。团队发现,传统测试框架在每次动作后会丢弃模型的私有推理过程,且采用滚动截断窗口导致历史记忆丢失,严重破坏了模型的持续学习能力。

通过在其 Responses API 中启用私有推理保留与上下文压缩两项设置,模型能够保留跨步骤的思考脉络与历史策略,同时使输出 Token 数量减少至原来的六分之一。这一发现表明,大模型在复杂智能体任务上的实际表现极大程度上取决于底层 API 与 Harness 的上下文管理机制。

MiniMax 推出 H3 多模态生成模型并计划开源模型权重

MiniMax 正式发布通用多模态生成模型 MiniMax H3,支持文本、图像、视频与音频的统一上下文理解与跨模态生成。该模型可直接生成带原生立体声音效的视频,支持最高 2K 分辨率及长达 15 秒的动态内容,并在指令遵循、文本与品牌渲染以及视频对视频动作迁移方面展现出商业级实用价值。

技术架构上,H3 打破了过去图像生成与音频/视频生成之间的任务边界,采用 Contextual Omni Representation 与 H3-Omni Transformer,在预训练阶段融合全模态数据。MiniMax 承诺在遵守相关法规的前提下,于近期开源 H3 的模型权重,以推动 AI 硬件适配与开源社区生态发展。

GitHub 推出 Stacked Pull Requests 公测版:支持分层代码审查与一键合并

GitHub 宣布正式公测 Stacked Pull Requests(堆栈式 PR)功能,旨在解决大型代码变更难以高效审查的痛点。开发人员可以通过命令行工具 gh-stack 或网页端将复杂的巨型变更拆分为多个按依赖顺序排列的小型 PR,审查人员能够并行独立审查各个层级,而不会阻塞后续开发。

当底层变更获批后,开发者仅需一次点击即可批量合并整个堆栈或部分层级,上层未合并的 PR 会自动进行变基并调整目标分支。该功能全面集成 GitHub 现有的分支保护规则与 Merge Queue,帮助团队建立更短的反馈循环并提高代码审查质量。

埃隆·马斯克接受《经济学人》专访:预言 AI 将在五年内超越人类总智慧

埃隆·马斯克在特斯拉德州超级工厂接受《经济学人》主编专访,展望了未来十年的科技与经济格局。马斯克预测,人工智能将在约五年内超越全人类智能的总和,并在十年内带来“极致丰富”的经济时代,届时数字智能与人形机器人的结合将彻底改变传统生产与服务模式。

访谈还涵盖了多项重大议题,包括 SpaceX IPO 后的收入结构转变、对 Sam Altman 及其他 AI 巨头的评价、Starlink 在乌克兰战场的作用,以及他对欧洲政治与自身卷入政治程度的反思。

谷歌首席科学家 Jeff Dean 谈 AI 时代:推理专用硬件与自动化 ML 实验是下一波浪潮

谷歌首席科学家 Jeff Dean 在 Y Combinator Startup School 2026 演讲中,分享了他对 AI 演进路径与硬件架构的深刻洞察。Dean 指出,当前 AI 模型在长期代码编写与复杂代理任务上已具备初级工程师的能力,未来两年的重大突破将来自于机器学习系统自身的自动化实验与自我改进。

针对硬件与基础设施,Dean 强调推理正成为 AI 普及的关键瓶颈。相比通用计算设备,低延迟、高能效的推理专用硬件将带来 50 倍以上的性能提升。同时,他建议创业团队聚焦于长上下文工程与可量化目标的自动优化系统。

Cloudflare 将开源 CDN 巨头 cdnjs 完整迁移至自身开发者平台

Cloudflare 宣布旗下承载全球 12% 网站流量、日均请求量达 90 亿次的开源前端资源库 cdnjs 已全面迁移至 Cloudflare 开发者平台。过去 cdnjs 的发布流水线依赖 GCP 函数与虚拟机,存在跨云协调困难和可观测性差的问题;如今其整体架构已原生运行于 Workers、Workflows、D1、R2 和 Containers 之上。

文章特别指出,在现代 Web 开发中 cdnjs 流量持续高企的一大核心驱动力是 LLM,代码生成模型在构建前端 Demo 时高度倾向于调用 cdnjs 格式统一、不可变且安全的资源链接,使其成为 AI 时代不可或缺的底层基础设施。

agentOS:基于 WebAssembly 与 V8 的 AI 智能体轻量级虚拟操作系统

Rivet 团队推出 agentOS,一个专为 AI 智能体设计的轻量级虚拟操作系统 SDK,允许开发者直接在现有后端进程中为智能体提供文件系统、进程执行与应用编排能力。该系统摒弃了传统虚拟机与 Docker 沙盒的沉重架构,采用与 Chrome 及 Cloudflare Workers 相同的 WebAssembly 与 V8 Isolates 技术。

基准测试显示,agentOS 的冷启动时间仅为 4.8 毫秒(比传统沙盒快 92 倍),每个实例内存占用约 22 MB(小 47 倍),运行成本降低 254 倍。系统支持 Node.js、Python 与 Bash,兼容 Pi、Claude Code、Codex 等主流智能体框架。

AI 程序员 Devin 母公司 Cognition 收购短信智能体 Poke 团队

突破性 AI 软件工程师 Devin 的开发商 Cognition 宣布收购 The Interaction Company。后者开发的 Poke 是一款直接运行于 Apple Messages 原生短信协议上的个人 AI 智能体,用户在过去三个月中与其交互了超过 1 亿条消息。

Cognition 创始人 Scott Wu 表示,Poke 在主动跟随、个性化记忆与人机交互情感体验方面具备独特优势。收购完成后,Poke 将接入 Cognition 的模型与云端基础设施以提升响应速度,两家团队将共同探索“始终在线”的云端智能体交互范式。

Mitchell Hashimoto 深入解析 Superlogical:打破传统终端复用器性能瓶颈

HashiCorp 联合创始人 Mitchell Hashimoto 详细阐述了新一代终端复用器 Superlogical 的底层架构突破。传统复用器如 tmux 与 Zellij 介于终端模拟器与 pty 之间,会导致重复解析与双重状态处理,显著降低现代高性能终端的渲染速度。Superlogical 基于 libghostty 构建,采用分布式同步状态机架构,实现了服务端与客户端的解耦。

在 Superlogical 模式下,服务端直接向客户端广播原始 pty 字节流,由每个客户端本地独立完成渲染与视口控制,解决了 tmux 中一人滚动影响所有人的痛点。此外,Superlogical 提供了对浏览器、移动端与多操作系统的原生分屏支持,极大提升了终端工具的迭代速度与扩展性。

硬件初创公司 Applied Electrodynamics 推出 WaveSight 穿墙透视相机

由前 Apple、Google 及 MIT 工程师创立、YC 孵化的硬件公司 Applied Electrodynamics 推出 WaveSight 穿墙透视相机。该设备能够穿透墙体与表面,以毫米级精度映射建筑物内的机械、电气与管道系统,补齐了建筑信息模型在竣工检验中的空缺。

相比热成像与激光雷达,WaveSight 具备更强的穿透力,可用于施工现场的隐蔽工程质量检测、工业生产线上的零件存在性校验,以及安检场景下的隐蔽物品扫描。产品目前已开启预订。

shadcn 推出 macOS 灵感收集与提示词管理工具 Copper

知名 UI 库开发者 shadcn 推出专为 AI 辅助工作流程打造的 macOS 应用 Copper。该软件集成了剪贴板管理、待办清单与暂存本功能,旨在解决开发者在 ChatGPT、Claude 与 Cursor 等多个 AI 工具间切换时信息碎片化的难题。

用户可通过双击 Shift 快捷键随时捕捉屏幕上的文字、链接与想法,并在 Copper 中提前编写后续提示词,顺畅复制回 AI 对话框。为保证数据隐私,Copper 不设云端同步与用户账号,所有笔记均以本地文件形式存储于 Mac 设备中。

听障无障碍通话应用 Rylo 完成 8500 万美元融资并完成品牌重塑

无障碍通信技术公司 Rylo(原名 Nagish)宣布完成 8500 万美元融资并正式更名。该公司开发了一款面向聋人和听障人士的免费电话字幕与实时转写应用,获得了美国联邦通信委员会的官方认证。

Rylo 能够在通话过程中提供高精度的实时文字转写,支持用户保持原有手机号码,并通过语音或打字方式进行回复。所有通话记录与转写文本均存储于用户本地设备,保障通信隐私。

龙与地下城推出《魔兽世界》跑团规则书与经典副本模组

威智圈与暴雪娱乐合作推出《D&D: World of Warcraft》桌面角色扮演游戏规则集。玩家可在 D&D 5E 体系下体验魔兽世界全部 13 个职业、9 个全新及修订子职业、40 多个专精,以及 11 个全新种族与 60 多种新法术。

规则集收录了包括死亡矿井、血色修道院、艾祖卓-尼鲁布在内的 7 个经典地下城模组,并推出了独立的《冰冠堡垒》团队副本地图包,供玩家组队挑战巫妖王。官方跑团节目《Dungeon Masters》也将于 9 月底开启魔兽世界主题新战役。

T3 Code 推出远程 AI 编程环境控制移动端 Companion App

T3 Tools 推出 T3 Code Mobile,这是一款运行于 iPad 和 iPhone 平台的 Companion 应用,旨在帮助开发者远程控制其 T3 Code 开发环境。用户可通过配对码或 T3 Connect 连接远程环境,在移动设备上启动 AI Agent 任务、浏览代码文件、执行 Git 版本控制操作、查看 Diff 变更并使用终端。