# DeepSeek V4-Flash 杀入帕累托前沿、谷歌 Gemini Robotics 2 全身操控｜AI 日报 2026-08-01


<!--more-->

> 今日 AI 领域两条主线齐头并进：**AI Coding** 侧，DeepSeek V4-Flash 用 130 亿激活参数在 Agent 能力上反超自家万亿级 Pro 预览版，把单次任务成本压到 3 美分，同时斯坦福等团队提出"验证缩放"第四维度，为长链路智能体可靠性补上关键一环；**具身智能**侧，谷歌 Gemini Robotics 2 突破上半身局限实现全身协同，商汤 ACE-Brain-0.5 单 8B 模型横扫多项评测，墨奇智能拿下超 10 亿元天使轮——资本与技术双轮驱动，行业从"能动"迈向"能干活"。

## AI Coding

### 1. DeepSeek V4-Flash 正式版上线：Agent 任务成本降至 3 美分

没有发布会、没有预热，DeepSeek 在 7 月 31 日通过 API 文档更新日志悄然上线 V4-Flash 正式版公测。这份"反常识"的成绩单相当亮眼：Terminal Bench 2.1 拿下 82.7 分，Cybergym 76.7 分，Toolathlon Verified 70.3 分，DSBench-FullStack 68.7 分，DSBench-Hard 59.6 分——这不是"能写代码"的模型，而是"能像工程师一样打开终端、分析仓库、调用工具、完成端到端任务"的模型。

更关键的是参数账：总参数 2840 亿、激活参数仅 130 亿，而三个月前的 V4-Pro 预览版总参数 1.6 万亿、激活参数 490 亿。Flash 用不到 Pro 三分之一的激活参数，在 Agent 能力上全面反超自家 Pro 预览版。海外评测机构 Artificial Analysis 给出 50 分智能指数，比原版 V4-Flash 高 10 分，比 V4-Pro 预览版还高 6 分，在帕累托前沿上以最低成本拿到最高智能分数。

值得关注的是技术路径：官方明确表示模型结构、尺寸与 preview 版完全一致，**仅重新进行了后训练**。不换发动机、只调变速箱，就能实现能力跃迁，这给"后训练是否被严重低估"提供了强力证据。当 Agent 阶段的竞争焦点从"最强模型"转向"足够强、足够快、足够便宜"，DeepSeek 正在重新定义性价比标杆。

### 2. 验证缩放：被忽视的第四维度

斯坦福 × 伯克利 × NVIDIA Research 联合团队发表论文《LLM-as-a-Verifier》，提出"验证缩放"（verification scaling）作为继预训练、后训练、测试时计算之后的**第四条能力增长轴线**。

方法本身很巧妙：不再让判官模型给出粗糙的 1–5 分，而是对评分词元的 logit 分布取期望，得到连续分数，再沿三个轴向缩放验证算力——粒度细化、重复评估、准则分解。结果在四个领域达到 SOTA：Terminal-Bench V2 86.5%、SWE-Bench Verified 78.2%、RoboRewardBench 87.4%、MedAgentBench 73.3%。

值得关注的是，这个验证器还能充当"智能体进度条"——在运行过程中追踪完成度——以及强化学习的密集奖励信号，**且无需重新训练权重、无需训练奖励模型**。当 Agent 轨迹越来越长、越来越贵，选对轨迹和生成轨迹同样重要。这给了团队一条不重训就能提升智能体可靠性的路径，覆盖编码、机器人和医疗应用。生成侧缩放定律已被充分映射，验证侧则是长期被忽视的盲区，这篇论文正在补上这块拼图。

### 3. 词元无限 InfCode：SWE-Bench 79.4% 超越 GPT-5 与 Claude

北京企业级 AI 智能体基础设施公司"词元无限"7 月 27 日宣布完成天使++ 轮融资，由临芯投资领投、华控基金跟投——这是自 2025 年 7 月成立以来一年内的第三轮融资，累计数亿元人民币。

其编码智能体 InfCode 的成绩单相当硬核：2025 年 12 月登顶 Multi-SWE-bench Java 榜单，SWE-Bench Verified Pass@1 达到 79.4%，在同一评测下超过 GPT-5 和 Claude。与消费级编码助手不同，InfCode 瞄准的是生产级企业系统——理解海量遗留代码库、通过安全审计、嵌入 CI 流水线，合同金额已深入千万级人民币。CEO 杨萍此前在字节跳动主导 AI 技术，创建了字节首个软件工程实验室，其多智能体测试系统曾应用于字节核心产品线。

一年三轮、间隔不断缩短，信号很明确：资本正在看好中国企业级 AI 编码赛道。这里的赌注与 C 端 Cursor 式订阅工具不同——企业级智能体的胜负手在集成深度和可审计性，而非定价。词元无限的目标是打造中国首个全自主、高安全、自进化的企业 AI 智能体基础设施平台。

### 4. Cursor 研发通用智能体 Sand，对标 Anthropic Claude Cowork

代码编辑器厂商 Cursor 正在开发一款通用 AI 智能体，内部代号 **Sand**，对标 Anthropic 旗下热门工具 Claude Cowork。这是 Cursor 拓宽业务边界、摆脱单一代码工具依赖的战略布局。

知情人士透露，Cursor 自 4 月起向 SpaceXAI 租赁算力启动研发，而 SpaceX 计划以 600 亿美元收购 Cursor，Sand 落地后将为 SpaceXAI 的企业业务提供支撑。双方此前已联合推出兼顾工程开发与通用办公的 Grok 4.5 大模型。Sand 是 Cursor 首款面向普通办公人群而非程序员的产品——除了代码开发，还能自动回复邮件、短信、整理表格等日常办公事务。6 月底已完成内部灰度上线，部分产品团队正在测试打磨。

能否正式公开发售仍存变数：Cursor 一贯先内部试用再评估，加之即将被收购，原有产品路线可能被打乱。但若顺利上线，Sand 将涌入竞争白热化的 AI 办公助手赛道，与 Claude Cowork、微软 Copilot 等正面交锋。从代码编辑器到通用办公智能体，Cursor 的野心正在扩张。

### 5. AI 编程工具价格战白热化：OpenAI 大幅降价、智谱 GLM Coding Plan 回归

Token 价格战持续升温。OpenAI 发布仅三周的 GPT-5.6 Terra、Luna 两款模型下调定价：**Luna 降价幅度达 80%，Terra 降价 20%**，旗舰 Sol 定价维持不变。此举应对的是企业控本需求与谷歌、微软、Anthropic 及国产开源模型的激烈竞争。当下企业严控 AI 使用开支，多款高性价比闭源、开源模型接连推出，倒逼厂商下调 API 成本。

与此同时，智谱宣布 GLM Coding Plan 编程订阅套餐回归，月费 118 元起，采用透明积分制，各类 Token 消耗规则公开清晰，周末使用享受低峰折扣。8 月 15 日前包年享 7 折、包季享 8 折限时优惠。该套餐面向编程人群，支持代码生成、调试、代码库问答等 AI 开发功能。

值得关注的是行业趋势：当模型能力趋同、差异化收窄，价格成为争夺开发者的核心杠杆。OpenAI 用 80% 的降幅守住市场份额，国产厂商用透明积分制和本地化定价争夺存量用户——AI 编程工具正在从"能力竞争"转入"性价比竞争"阶段，受益的是每一位开发者。

## 具身智能

### 6. 谷歌 Gemini Robotics 2：从上半身到全身协同操控

谷歌 DeepMind 发布 Gemini Robotics 2 机器人 AI 模型，突破了前代仅能控制上半身的局限，可实现**人形机器人全身协同操控**。演示中该模型驱动 Apollo 机器人自主避障、完成取放物品全套操作。

配套方面，谷歌同步推出 ER 2 和 On-Device 2 两款模型：前者支持多步骤任务规划，后者面向端侧部署，并支持多机协同。官方坦言机器人动作仍偏迟缓、商业化落地尚远，但加码机器人赛道的意图明显——直面 OpenAI、英伟达的行业竞争。

从"能动上半身"到"全身协调"，这一跨越的意义在于：人形机器人要真正进入工厂或家庭，全身运动协调是绕不开的工程门槛。Gemini Robotics 2 把这条线推过了一大截，但"动作偏迟缓"的自我承认也说明，从实验室演示到可商用的速度和可靠性，仍有不小距离。

### 7. 深圳墨奇智能获超 10 亿元天使轮，阿里腾讯联合投资

7 月 31 日业内消息确认，深圳墨奇智能完成超 10 亿元天使轮融资，由阿里、腾讯联合投资，聚焦**通用人形机器人全栈研发**。团队核心人员来自自动驾驶领域，打算把智能驾驶的数据闭环、端到端算法思路迁移到机器人控制体系中，走软硬件一体化自研路线。

现阶段很多人形机器人方案存在硬件、算法分属不同厂商、整体适配难度大的痛点。墨奇计划从商用场景优先切入，先在工厂柔性分拣、商业服务领域落地，再逐步迭代。本轮资金重点投入运动控制算法和多模态感知基座大模型研发。

天使轮就超 10 亿元、阿里腾讯联手——这在一级市场并不常见，说明头部资本对具身智能赛道的押注已进入"重注"阶段。把自动驾驶的成熟方法论（数据闭环、端到端）迁移到机器人，是一条被验证过想象力的路径。随着越来越多大厂入局，国内具身智能领域的竞争将进一步加剧。

### 8. 商汤大晓机器人开源 ACE-Brain-0.5：单 8B 模型横扫多项评测

商汤科技旗下大晓机器人正式开源新一代统一具身基模型 **ACE-Brain-0.5**，面向 Physical Agentic AI 新范式，推动具身智能走向真实物理世界中的自主执行。

作为 ACE-Brain-0 的重大升级，ACE-Brain-0.5 以空间智能为底座，将机器人基础模型从"理解世界"推进至"理解、规划、行动、评估"一体化的闭环认知阶段。在多项国际权威具身智能评测中，这个单一 8B 具身基模型系统性超越了 OpenAI GPT-5.4、谷歌 Gemini-2.5-Pro、Anthropic Claude-Sonnet-4.6、英伟达 GR00T N1.6、Physical Intelligence π₀/π₀.₅ 等全球主流开源与闭源模型。

消息发布后，商汤-W（00020）盘中涨超 7%。8B 参数就能在具身评测中超越一众更大体量的对手，说明在机器人领域"小而精"的路线有其独特价值——尤其考虑到端侧部署对模型体积和推理延迟的硬约束。开源策略则有望加速生态构建，让更多研究者和企业能在统一基座上做应用创新。

### 9. 高通人形机器人演示现场倒地：硬件可靠性仍是硬门槛

在一场旨在展现前沿技术的演示环节中，一台搭载高通芯片、具备高算力的人形机器人发生严重故障。事发时该机器人正在现场配合高通高管展示软硬件架构，却在演示过程中突然失去控制、体态严重变形并向后倒塌，现场气氛降至冰点。

该故障设备为高通合作伙伴 Neura Robotics 研制的 4NE1 Gen 3.5 人形机器人，集成高通机器人参考设计架构，设计续航 6 至 8 小时，具备可观负载能力。高通事后回应称机器人触发了既定的"安全下蹲/折叠"保护机制，旨在降低重心防止摔倒造成伤害。但搬运过程中再次发生掉落的尴尬场面，让"保护机制"的说法显得牵强。

这并非孤例——近期机器人行业展会中，公开演示瘫倒的情况已多次出现。算力再高、模型再强，如果硬件可靠性过不了关，人形机器人就难以走出实验室。这起事故提醒行业：从"能演示"到"能干活"，中间隔着的是无数次故障迭代和工程打磨。

### 10. 宇树科技人形机器人：8.5 万元量产背后的产业链底气

宇树科技的人形机器人近期引发行业关注。2025 年宇树 G1 首发价 9.9 万元，到 2026 年基础版已降至 **8.5 万元**；而本田 ASIMO 当年单台造价超 250 万美元且只租不卖，欧美高端人形机器人原型机售价仍在几十万到上百万美元之间。

关键在于这并非实验室样机，而是实打实进入工厂、医院、高校的量产货。2025 年全球人形机器人出货量约 1.3–1.6 万台，中国厂商占近九成，仅宇树一家就卖出 5500 多台。拆解层面，脚踝关节巴掌大的区域塞进了电机、减速器、编码器、驱动器四大件，四合一集成模组靠连杆和轴承，外部找不到多余走线——集成度之高让业内拆解团队感叹。

这不是单纯的技术问题，而是完整产业链和极致成本控制带来的底气。当机器人从实验室拉到普通人能用的场景，量产能力和成本曲线就成了真正的护城河。宇树的案例说明：在具身智能赛道，谁先把价格打下来、把量做上去，谁就掌握了定义市场的话语权。

---

**总结**：今天的 AI 领域呈现"双线并进"的格局。AI Coding 侧，DeepSeek 用后训练魔法证明"不换模型也能跃迁"，验证缩放补上了智能体可靠性的关键拼图，价格战则把红利交给了开发者；具身智能侧，谷歌和商秀在模型层突破全身协同与单模型多任务，墨奇智能的重注融资和宇树的量产成本曲线，则说明资本和产业链正在同步加码。从"能写代码"到"能像工程师一样工作"，从"能动上半身"到"全身协调"——两条主线都在从能力验证走向真实落地。

> 以上内容基于公开信息整理，仅供参考。

