VC Top 7 周报 — 2026-W35
VC Top 7 周报 — 2026-W35
_Generated 2026-08-30 via NotebookLM (notebook 61acbd41)_
Source 索引
48d65d2b— Can Agents Use a Computer Yet? We've Got the Data | Andreessen Horowitzc48d08d8— Fei-Fei Li is Solving the Hardest Problem in Robotics | World Labs with a16zd9b88f6d— The Machine Age Fund | Andreessen Horowitz00c27684— You are not a model. Don't price per token. | Andreessen Horowitz
执行摘要
- 计算机使用智能体(Computer-use Agents)已跨越商业化拐点,其竞争壁垒正在从底层模型层向应用与上下文层转移。 截至2026年,最先进的计算机使用模型在OSWorld-Verified基准测试中得分已达85%(Claude Fable 5),超越了人类测试者约72%的表现 [1, 2]。随着UI导航等基础能力逐渐商品化,智能体的真正差异化优势正转向具体企业的业务流程、专属上下文、“部落知识”(tribal knowledge)以及异常处理和验证机制 [3, 4]。企业买家更加关注的是智能体在遇到异常时的工程自愈能力与出错管理,而非 leaderboard 上的模型排名 [5, 6]。
为什么这条对投资人 / 行业重要:这表明纯模型API的竞争壁垒正在快速削弱,资金与技术评估应当优先倾斜于那些能够深耕垂直工作流、掌握企业专属数据并构建起高可用性工程外壳的应用层初创公司。
- 物理AI基础设施与硬件初创企业迎来爆发期,投资机构开始设立巨额专项基金来解决AI算力和供应链的物理瓶颈。 硅谷风投机构(如a16z)已为其最新的“机器时代基金”(Machine Age Fund)募集了11亿美元,专门投资芯片、内存、网络、存储及数据中心等物理AI基础设施 [7, 8]。这一举措的背景是硬件初创公司的项目流占比已从几年前极低比例飙升至现在的20%以上 [9]。随着机架功率从5-10 kW暴增至100-250 kW(未来3年预计达1MW),AI系统的能耗与密度正急剧逼近物理和电网的极限 [10]。
为什么这条对投资人 / 行业重要:硬件不再是软件基金的边缘选项,而是一个亟需物理重构的万亿级赛道,提前布局高密度散热、新型内存层次结构及专属能源系统的硬件企业将获得长期的行业溢价。
- 具身智能与机器人技术的突破关键,在于构建高一致性的“虚实结合”(Real-to-Sim-to-Real)模拟训练环境,以破解机器人行业面临的严重数据匮乏。 相比于互联网上海量的文本,机器人在物理交互中的高保真数据极度匮乏,这限制了其规模化效应的释放 [11]。World Labs通过收购机器人模拟器公司Scenix,致力于利用其Marble等大世界模型构建高度一致的3D数字孪生环境,在虚拟世界中进行可控的随机化演练与快速评测 [12-14]。这种“具身与模型双模不敏感”(embodiment and model agnostic)的基础设施,让各类硬件机器人的迭代速度得以实现跨越式提升 [15-17]。
为什么这条对投资人 / 行业重要:这意味着机器人行业的终局并非比拼制造出完美的单一人形硬件,而是谁能掌握高效、低成本且高可靠性的通用“虚拟训练场”基础设施,这将成为机器人规模化落地的核心乘数。
- AI应用层公司必须坚决摒弃“按Token计费”的定价模式,转而向 credits(额度制)或 outcomes(结果计费)演进,以实现价值显性化并保护毛利率。 将定价逻辑锚定在Token上会将底层模型提供商的成本结构强加给客户,并把产品价值绑架在不断走低的算力曲线上 [18, 19]。相反,AI应用应当采用 credits 等形式将计算复杂度转化为客户直观理解的工作单元(如完成一次报告、修复一个Bug),在更高的价值层进行定价 [18, 20]。这不仅能满足企业财务对预算确定性的基本诉求,还能让软件商在底层算力成本下降或代码路由优化时,安全地留存更多的毛利空间 [21, 22]。
为什么这条对投资人 / 行业重要:定价模式的科学转型,是判断一家AI应用公司能否从“代售算力的中介”升级为“拥有高毛利、高留存率的可持续商业模式(SaaS 2.0)”的关键分水岭。
- 计算机使用智能体在后台办公(Back-office)场景中的经济奇点已经到来,正在全面颠覆传统BPO(业务流程外包)的成本结构。 即使采用在UI屏幕上逐张截图运行的前沿模型智能体,其运行成本也仅为每小时 \$6-\$8,不仅比 \$30-\$45/小时的美国后台人工便宜70%-80%,更在最差情况下也能与约 \$10/小时的离岸BPO(如印度)基本持平 [23, 24]。通过在工程上利用低成本的确定性代码处理重复部分,并在出错时调用模型进行“自愈”和重新缓存, blended 成本能被进一步大幅拉低 [6, 24]。尽管智能体在执行某些复杂长路径任务时速度仍慢于人类,但其24/7不间断服务和无缝扩展的能力使其商业化ROI已经实现闭环 [25, 26]。
为什么这条对投资人 / 行业重要:这标志着全球传统BPO行业即将迎来毁灭性重构,企业运营团队和投资人需要迅速将依赖繁琐人工操作旧系统的后台业务,向“智能体外包”方向迁移。
跨 Source 共识与分歧
1. 共识
- 共识一:AI 的实用性与场景深度已在过去一年(2025–2026年)迎来临界点,正式从“概念演示(Demo)”跨入大规模、高可靠的生产环境落地阶段。
- Can Agents Use a Computer Yet?:指出计算机使用智能体(Computer-use Agents)在过去18个月里实现了技术跃升,OSWorld 真实桌面任务测试得分从42%飙升至85%(超越人类的72%),使得基于 API 的智能体在 back-office 场景中从 Demo 走向真正的规模化生产部署 [1-3]。
- The Machine Age Fund:提到过去一年中 AI 的实用性与工作多样性迎来了向上的拐点,AI 正从简单的聊天对话进化到复杂的推理、编码及各行业垂直知识工作 [4]。
- Fei-Fei Li video:阐述了具身智能(Robotics)的学习算法和系统演进速度远远超出了研究人员的预期,并且其设计合作伙伴已开始在实验室、仓库及电子装配等实际部署场景中测试高实用性的解决方案 [5-7]。
- Takeaway:AI 已经全面跨越“技术尝鲜”阶段,进入了能够在真实物理世界和复杂企业工作流中产生可衡量经济效益的生产级落地黄金期 [1, 4, 5]。
- 共识二:底层大模型的原生能力正在被商品化,AI 产业链的护城河和核心差异化优势正在向应用层、上下文层和专用软件基础设施转移。
- Can Agents Use a Computer Yet?:强调随着 UI 导航等执行层被模型底座抽象,真正的壁垒转移到了由具体企业的“部落知识(tribal knowledge)”、业务流程、异常验证和安全权限组成的上下文层 [8, 9]。
- You are not a model. Don't price per token.:指出 AI 应用的本质是整合专有数据、工作流逻辑和多模型编排来为客户交付可识别的业务结果,其商业护城河应该建立在这一编排和应用层,而非底层模型本身 [10-12]。
- Fei-Fei Li video:提到他们所构建的用于机器人训练的“虚实结合(real-to-sim-to-real)”基础设施是完全“模型无关(model-agnostic)”和“硬件无关(embodiment-agnostic)”的,这使得其价值能够沉淀于通用的模拟仿真系统与数据中 [13, 14]。
- Takeaway:纯大模型 API 的竞争壁垒正在迅速被削弱,未来长效的商业壁垒将由深谙垂直业务逻辑、掌握核心私有上下文以及具备强大工程编排能力的软硬件基础设施厂商共同构建 [8, 12, 14]。
- 共识三:AI 在运行中存在高昂且难以预测的推理、重试(retries)及异常处理成本,企业必须采用先进的工程手段来保护商业毛利率。
- Can Agents Use a Computer Yet?:提到智能体在运行中如果出错或遇到未定义路径仍会消耗大量 Token,企业买家主要通过在工程上把智能体运行成功的路径缓存(cache)为“确定性代码”来大幅降低后续成本,只在出错时调用大模型自愈 [15-17]。
- You are not a model. Don't price per token.:强调 AI 应用的每一次用户交互都会带来检索、搜索、媒体生成、重试和失败运行等复杂的物理成本,企业需要将定价与这些波动成本解耦,并通过模型路由优化、缓存以及混合使用开源模型来保护自身毛利 [18, 19]。
- Takeaway:由于 AI 的每一次调用和错误重试都伴随着真实的物理算力消耗,开发商必须在底层利用代码缓存、智能模型路由等工程策略来平抑成本,以保证商业模式的盈利能力 [16, 18, 19]。
- 共识四:AI 的爆发正在全面重构物理世界的基础设施,对计算硬件、能源供应及机器人物理系统的需求正经历爆发式增长。
- The Machine Age Fund:指出 AI 算力需求正逼近物理学、材料学和计算机科学的极限,硅谷的硬件初创公司交易流占比已飙升至 20% 以上,芯片、内存、存储及电力能源系统亟需全面物理重构 [20-22]。
- Fei-Fei Li video:强调让 AI 智能体进入物理空间与实体交互(即机器人学)是未来 AI 领域最重要且影响最深远的方向,虽然系统性的物理软硬件整合难度极大,但其需求正在垂直行业中被率先点燃 [23-25]。
- Takeaway:AI 正在以前所未有的深度向物理空间渗透,这推动了从高密度电网、散热硬件到具身智能机器人在内的整个“物理 AI(Physical AI)”基础设施的万亿级重构 [20, 22, 23]。
2. 分歧
- 分歧一:机器人策略训练应当采用“纯视频模型预测(Video-only prediction)”还是“3D几何高保真模拟(3D simulation & physics consistent models)”?
- 立场 A(纯视频模型):行业中许多机器人公司或研究人员采用直接基于大规模视频数据集训练端到端视频预测模型的方法,让机器人通过观察视频画面的变化来进行交互学习 [26, 27]。
- 立场 B(3D几何高保真模拟):World Labs 与 Scenix 认为,现有的视频预测模型常常出现“物体在被推开后魔法般消失”等物理和几何不一致的问题,这无法给机器人提供有效的学习信号 [27]。他们坚信机器人训练必须依赖像 Marble 这样能够保证空间、时间、视角和多模态交互均完全一致的 3D 几何与物理双重拟真环境 [26-28]。
- 分歧二:AI 应用应该坚决杜绝“按 Token 计费”而采用基于工作价值的额度(Credits/Outcomes)计费,还是在高度竞争或高成本波动场景中必须保留“Token透传(Token pass-through)”?
- 立场 A(彻底去 Token 化,按 Credits 或 Outcome 计费):Don't price per token 主张,将应用层定价与 Token 挂钩是把底层模型商的成本压力强加给客户,并且会被暴跌的模型成本曲线绑架;必须按用户理解的工作单元(如修复一个Bug、完成一份分析)来收 Credits 甚至直接按商业结果(Outcome)收费,从而安全存留由于算力成本下降带来的超额毛利 [11, 12, 19, 29]。
- 立场 B(对极端/高波动性模型仍需保留 Token 透传的混合定价):该报告也指出,在高度竞争或技术极其成熟的市场,以及面对极其昂贵、不确定性极高的推理模型(如某些前沿推理模型)时,企业可能不得不默认采用 Token 透传(不加价)的形式由用户买单,例如数据平台 Clay 也会将昂贵且多变的推理模型按实际 Token 消耗透传给用户,以避免自身毛利率被瞬间吞噬 [29-31]。
- 分歧三:AI 智能体在处理具体业务任务时,运行速度到底是“已经实现超人级的超速执行(Super-human speed)”,还是“依然比人类慢得多(Significantly slower than human)”?
- 立场 A(AI 运行远快于人类):The Machine Age Fund 与 Fei-Fei Li video 强调,在数字仿真环境(Sim)中,机器人和代码的运行能够进行系统性、数量级上的加速(超过人类速度极限),且确定性代码的计算和执行速度在理论上是任何人类都无法比拟的 [32, 33]。
- 立场 B(AI 实际交互比人类慢得多):Can Agents Use a Computer Yet? 的实际部署数据显示,当智能体以屏幕截图和交互(Agentic mode)的方式操作计算机 UI 时,其速度远慢于人类:人类花2-3分钟就能做完的工作,智能体通常需要8-10分钟,这一效率差距在学术测试和实际生产中均被明确证实 [17]。其经济闭环并不依赖单次执行速度,而是依靠 24/7 不间断运行和无缝扩张的能力 [17]。
3. 独有视角
- Can Agents Use a Computer Yet?
- 独有核心观点:计算机使用智能体(CUA)在 back-office 后台办公场景中已经跨越了极具颠覆性的经济拐点。 即使在最昂贵的“纯截图运行”模式下,智能体的折算推理成本也已降至约 \$6-\$8/小时,不仅能在最差情况下与离岸 BPO 劳动力(如印度,约 \$10/小时)基本持平,面对美国本土 back-office 劳动力(约 \$30-\$45/小时)更是具备 70%-80% 的毛利空间。这标志着全球传统离岸外包(BPO)服务产业即将迎来物理级的替代 [34, 35]。
- Fei-Fei Li is Solving the Hardest Problem in Robotics
- 独有核心观点:机器人模拟训练(Simulation)的本质核心价值在于“反事实推理(Counterfactual Reasoning)”。 物理世界中用于训练机器人和评估的高保真交互数据极其匮乏,而在虚拟仿真世界中,机器人不仅可以安全、低成本、数万倍速地进行控制变量演练,更能够像人类大脑一样,演练那些“现实中从未发生、甚至在现实中不可能发生的安全极限案例(Counterfactuals)”,这是仅靠现实世界数据收集永远无法企及的瓶颈解法 [28, 36-38]。
- The Machine Age Fund
- 独有核心观点:AI 算力密度和电力密度的爆发式增长正在猛烈撞击现代电网与物理散热的物理极限(“Rearchitecting down to the electricity”)。 仅仅是从 H100 机架升级到 Rubin 机架,其计算密度就提升了 28 倍,使得单机架功耗从早期的 5-10 kW 飙升至 100-250 kW,并且预计在未来 3 年内暴增至 1MW(兆瓦)级别。这导致数据中心建设必须跳出传统公共电网,大量引入 behind-the-meter(表后配电)及专属捕获光源等全新配电与散热架构 [21, 33]。
- You are not a model. Don't price per token.
- 独有核心观点:AI 软件定价必须实现“计费计量仪(Billed Meter)”与“成本计量仪(Cost Meter)”的彻底分离。 计费计量仪应当用于呈现客户一眼就能看懂并认可的工作价值(如完成一次数据清洗或生成一份客户简报),而底层的成本计量仪则用来记录复杂的 Token 消耗、API 路由及 retries 次数。这种分离机制不仅能极大降低客户采购时面对无法预测费用的摩擦力,更能让应用厂商将大模型技术降价所带来的成本红利安全转化为自身的超额留存利润 [12, 19, 39]。
Source 逐家详解
Can Agents Use a Computer Yet?
核心立场:计算机使用智能体(Computer-use Agents)的技术能力在过去一年多里实现爆发式提升,已跨越商业落地的技术与经济临界点,其竞争壁垒也正在从底层模型向应用、上下文和工程化错误处理等外壳层转移 [1-3]。
核心要点:
- 技术成熟度跨越临界点:截至2026年,最先进的计算机使用模型在 OSWorld-Verified 真实桌面测试基准上的表现已达到 85%(以 Claude Fable 5 为代表),超越了人类测试者约 72% 的平均水平 [4, 5]。这使得智能体从一年前纯粹的 Demos 跨越到了可在真实生产环境中规模化部署的生产力阶段 [5, 6]。
- 深耕标准化后台协议任务效果最佳:智能体在处理路径明确、高标准化、且无 API 支持的 legacy 系统的长尾流程中表现最强(例如 CRM 数据录入、QA、登录门户、拉取合规数据以及 IT 工单处理等) [1, 7]。这些场景往往具有机器可直接观测的结果,并且容错和干预路径清晰 [7, 8]。
- 核心护城河全面向上下文和企业专有软件层转移:由于底层模型的 UI 导航与基础交互能力正在快速被底座抽象和商品化,企业的核心壁垒转变为对 tribal knowledge、内部术语、runbooks 流程规范、异常处理方案、特定组织验证机制以及严格权限系统的掌控 [2, 9]。
- 通过工程架构缓存(Caching)平抑高昂的 AI 运行成本:AI 在运行中如果产生重试或偏离流程,其推理费用将呈爆发式增长 [10, 11]。先进企业会采用“只调用大模型跑通一次,然后将其缓存为确定性代码在本地低价复现”的机制,只在界面变化报错时重新召回模型进行“自愈和重新缓存”,极大地降低了生命周期的平均成本 [3, 12]。
- 对海外离岸及本土后台办公外包(BPO)形成物理级替代:哪怕在频繁截屏运行、算力消耗最大的最昂贵推理模式下,智能体折合的 inference 成本也仅为每小时 \$6-\$8(低至 \$3-\$15),已经能够在最差情况下与海外离岸 BPO(如印度,约 \$10/小时)持平,并在面对美国本地劳动力(约 \$30-\$45/小时)时展现出 70%-80% 的显著毛利空间 [3, 13]。
- 智能体单次速度比人类慢,但具备极强的综合商业 ROI:在纯 Agentic 交互模式下,人类只需 2-3 分钟就能搞定的繁琐 UI 工作,智能体可能需要 8-10 分钟 [11]。但它能够 24/7 不间断运转,无需冗长的员工招聘与培训,并在业务量激增时瞬间弹性扩容,其综合经济闭环优势已不可阻挡 [10, 11]。
- 架构正向复杂的 Bespoke 多智能体系统演进:目前业界部署的大部分是处理单会话的单体智能体,面对更复杂的长程业务流程与延迟限制,团队正在构建专用的多智能体并行动作、规划分解及验证的 orchestration 框架,这也成为了当前急需被标准化和被投资的基础设施空白 [14]。
最重要的一句英文原文 Quote:
"When your heaviest users stop checking the leaderboard, the leaderboard has stopped being the story." [15]
中文解读: 当大模型技术最核心的企业用户不再关心各大模型实验室在排行榜上的刷分表现,而是直接将大模型作为底层硬件一样无感置换、只聚焦于业务流程落地和可靠性时,标志着该技术已经真正进入不看虚荣指标(Vanity Metrics)、只用生产力衡量价值的商业深水区 [15]。
与其他 Source 的呼应或对立点: 该 Source 高度呼应了《Don't price per token》关于 AI 在每一次执行重试、检索中存在高昂且难以预测的推理和错误成本,以及企业应采用缓存和工程架构来管理这些物理消耗的观点 [3, 12, 16]。同时,相比于《The Machine Age Fund》所强调的 AI 在仿真环境下远超人类极限的超人级运行速度,该 Source 务实地指出,在当前操作真实计算机 UI 界面时,智能体执行单次任务的速度实际上仍显著慢于人类 [11, 17]。
Fei-Fei Li is Solving the Hardest Problem in Robotics
核心立场:具身智能与机器人技术的规模化突破面临严重的高保真交互数据匮乏,通过 Marble 等 3D 生成式大世界模型构建在空间、时间、几何与物理交互上高度一致的“虚实结合(Real-to-Sim-to-Real)”模拟仿真训练环境是突破这一瓶颈的必然路径 [18-20]。
核心要点:
- 具身智能的核心瓶颈在于“数据荒”:与互联网上唾手可得的海量语言和文本数据不同,物理机器人在真实世界交互中的精准控制、摩擦系数、力学反馈等训练和评测数据极度稀缺,成为了解锁大模型“规模效应(scaling law)”的卡脖子难题 [20]。
- Real-to-Sim-to-Real 流程能够提供海量可扩展对齐数据:Scenix 团队的 Real-to-Sim-to-Real 管线能够将现实物理场景高效重建为与之高度对齐的 3D 数字孪生世界(包括外观、几何和物理动力学特性),使数字孪生中发生的每一次动作变化,都能几乎 100% 同步并重现在物理世界的实体上,以此廉价、安全、海量地产生高质量训练数据 [19, 21]。
- 模拟仿真的独特核心价值在于实现“反事实推理”:仿真的本质优势不仅在于规模化收集常规数据,更在于它能够支持“反事实推理(counterfactual reasoning)”——即让机器在脑海中像人类思考一样,安全且数万倍速地演练现实中极罕见甚至不可能主动发生的极限灾难、碰撞及安全临界情况 [18, 22, 23]。
- 仿真能够极大加速长期被忽视的测试评估(Evals)效率:评估(Evals)是机器人模型快速迭代的唯一反馈源,而在真实世界中进行测试速度极慢(因物理原子移动天生缓慢)、危险、昂贵且伴随高硬件维护成本,高度对齐的 Sim 仿真环境让这一评估迭代速度实现多个数量级的跨越式缩短 [24-26]。
- 利用 Sim 的随机化(Randomization)解决机器人的泛化难题:要在复杂多变的物理世界中获得可靠性,必须将机器人置于光线、阴影、摩擦力、几何偏差以及各种随机参数不断剧烈抖动的场景中进行训练。这些环境特征在物理世界中极难高频调节,但在 Sim 训练场内却能得到完美的系统性随机化覆盖 [17, 27]。
- 通过数字模拟打破人类物理运动速度的效率上限:依靠传统的实体硬件人工遥操作(Tele-operation)采集数据,其采集速度往往因为重力和人类物理操作延迟而低于工业部署对高效作业的要求。在 Sim 仿真中可以系统性地给物理过程进行几十倍的“时间加速”,训练出兼具高物理稳定性和超人执行效率的机器人策略 [17, 24]。
- 定位是底座级“双无关”软件基础设施:其技术方向不涉及任何机器人硬件原子制造,也不与特定机器大脑算法强绑定,而是作为一种完全“模型无关(model-agnostic)”与“硬件/具身无关(embodiment-agnostic)”的基础软件环境。任何机器人公司(不管是机械单臂、移动小车还是人形机器人)均可将大脑放入该环境中训练并快速部署 [28, 29]。
最重要的一句英文原文 Quote:
"There's a very important role simulation plays that real world data doesn't play which is counterfactual reasoning." [18, 22]
中文解读: 模拟仿真最核心且无法被现实数据取代的优势在于“反事实推理”。它允许机器人(像人类一样)在脑海中安全地推演从未发生或极端的潜在物理危机,并学会如何应对,这是仅靠采集日常现实数据永远无法突破的瓶颈 [22]。
与其他 Source 的呼应或对立点: 该 Source 强调在虚拟训练场(Sim)中可以对物理世界进行系统性加速,训练出“快于人类速度上限(faster than human speed)”的机器人,这与《The Machine Age Fund》对 AI 执行超越人类极限效率的宏观展望相呼应 [17, 30]。然而,这与《Can Agents Use a Computer Yet?》中所观察到的“智能体在 UI 层交互时目前仍明显慢于人类”的现实数据形成了针对不同落地阶段的有趣对立 [11]。
The Machine Age Fund
核心立场:AI 正进入从简单对话软件向垂直深层推理与知识工作演进的全新物理阶段,这带来了订单级剧增的 Token 强度和计算功耗,急需通过设立 11 亿美元专项基金,对从芯片、输电散热到物理机器人硬件的整个 AI 基础设施底座进行物理级的“重构和补课” [31-33]。
核心要点:
- AI 正在发生从“对话”到“推理/知识工作”的垂直型升维:AI 实用性与所能处理的任务广度正迎来向上的斜率临界点。当系统从日常 Chat 转向深层推理、自主 Code 生成和深度行业知识工作时,其对算力的 Token 使用强度和吞吐要求呈现几个数量级的物理跃升 [31]。
- AI 软硬件堆栈正在猛烈撞击现代全球物理供应链和材料学瓶颈:包括芯片、高频宽内存、高速网络互联及高密度存储在内的整个物理 AI 堆栈,都无一例外地撞到了当前供应链极限、材料物理极限以及经典计算机科学的边界 [32, 33]。
- 机架级计算密度和供电密度正在以不可思议的速度爆发:仅仅是从 H100 机架跨越到 Rubin 机架,其单机架计算密度就大幅提升了 28 倍,铜缆连接也已顶到了物理极限。单机架的电力功耗也从早期的 5-10 kW 猛增至 current systems 的 100-250 kW,并将在未来 3 年内朝着惊人的 1MW(兆瓦)级别演进 [30]。
- 算力园区跨入吉瓦(GW)纪元,需彻底重建电网配套:由于算力集群规模从十多兆瓦快速膨胀至数百兆瓦甚至出现吉瓦级园区,供电早已无法完全依赖现成公共电网。厂商不得不深度介入 behind-the-meter(表后配电)及直接配套建设专属发电源 [30]。
- 成立 11 亿美元“机器时代基金”全面下注物理世界:作为老牌软件投资机构的 a16z,为了应对这一千载难逢的硬件重构浪潮,专门成立了 11 亿美元的“Machine Age Fund”,重点投资支持高密度算力、散热系统、新材料、先进制造、机器人和家庭物理 AI 设备等物理硬件设施 [31, 32, 34]。
- 硬件类初创企业在项目流(Deal Flow)中的占比创下历史纪录:创始人正在敏锐地捕捉这一物理革命的信号,过去两年中,硬件硬科技类初创企业占 a16z 整体 Deal Flow 的比重已从原先的无足轻重,快速飙升到如今的 20% 以上 [35]。
最重要的一句英文原文 Quote:
"Compute density per rack increased by 28X from an H100 rack to a Rubin rack... Rack power moved from roughly 5-10 kW to 100-250 kW to support today's systems and will increase to 1MW over the next 3 years." [30]
中文解读: Rubin 机架将计算密度飙升了 28 倍,直接将单机架功耗从十多千瓦拉到数百千瓦甚至未来的兆瓦级别 [30]。这一组极端的物理数字揭示了 AI 的算力军备竞赛已完全成为一场对现代热物理、输配电网和机房散热技术的极限挑战,必须从底座物理层进行彻底重构 [30, 32]。
与其他 Source 的呼应或对立点: 该 Source 描绘的对 AI 物理基础设施与机器人硬件底座的迫切投资,高度呼应并支持了《Fei-Fei Li video》中关于具身智能与物理交互是 AI 终极战场的雄心与逻辑 [32, 36]。同时,其揭示的物理算力供电与运行成本飙升,也从深层原因上佐证了为什么《Don't price per token》对大模型应用软件控制重试次数、管理推理成本的策略对公司生存具有生死意义 [16, 30]。
You are not a model. Don't price per token.
核心立场:AI 应用层产品在定价模式上必须与底层大模型的物理计算消耗(Token)完全解耦,应通过额度制(Credits)或结果计费(Outcomes)等可量化、可理解的工作价值单元进行收费,从而保护企业自身毛利率并消弭客户采购预算的黑盒焦虑 [37-39]。
核心要点:
- 按 Token 计费是对应用层产品长效壁垒的慢性自杀:Token 是底层大模型商计量 raw inference 消耗的物理指标 [40]。如果在应用层把 Token 作为收费标准,无形中会将产品价值矮化为“裸算力代售”,抹杀了应用在专有数据整合、编排路由和业务逻辑等方面的增值服务,且在模型价格下行的趋势中会把公司价值锁死在下跌曲线上 [37, 38, 41]。
- 商业收费计量仪(Billing Meter)必须与底座成本计量仪(Cost Meter)实行彻底分离:AI 应用的每一次用户操作都隐含着多模型路由、信息检索、重试(retries)甚至运行失败所带来的复杂物理算力消耗 [16, 42]。应用商不应将这些高波动的物理黑盒费用直接转嫁给企业财务,而应将成本封装在后台,前台对外只呈现用户能够直观评估且认可的业务量和已完成价值 [42, 43]。
- 建立优秀的 Credits 体系应该对齐“努力带宽”而不是包装 Token:弱势的 Credit 只是换了层皮的 Token 换算。卓越的 Credit 体系应该把复杂的底层资源打包成直观的努力带宽(Effort bands),例如完成一次简单的 Bug 修复消耗极少,生成一次完整的多视角账户研究分析则消耗固定且可预知的 Credits 额度 [16, 44]。
- 强壮的 Credit 设计可以筑起保护 Gross Margin 的护城河:当应用商通过 Credit 在商业上将“向用户收取的价值”与“向底层付出的物理推理成本”解耦后,企业便能牢牢掌控高毛利的定价主动权 [39]。在模型底座降价、模型智能路由优化、精简 Prompt 或是使用开源模型的过程中,应用层公司可以平稳、安全地将降本所释放出来的所有红利沉淀为自身的超额留存毛利 [39]。
- 一旦业务结果清晰且可归因,应当决绝地向 Outcome 计费跃升:在 AI 技术成熟、能产生清晰可衡量结果的垂直场景(如“成功解决的一通客服电话”、“成功获取的合格 MQL 线索”、“成功追回的欠款”等),应用应当彻底向按 Outcome 计费转变,这是应用层软件所能拥有的最高毛利和最高防御壁垒的商业模式 [45]。
- 对于极端多变、极昂贵的前沿模型,可在应用中设立 Token 通道混合定价:作为混合商业策略的一环,若应用产品中必须提供某种技术刚突破、价格昂贵且推理极为波动的 reasoning models,企业可以学习 Clay 的做法,将这部分极高波动的模型消耗按 actual cost 零加价直接透传给用户,从而防止自身的平台毛利被昂贵的物理推理费用瞬间击穿 [41, 46]。
最重要的一句英文原文 Quote:
"Transparency does not require the billing meter and the underlying cost meter to be the same." [43]
中文解读: 商业的透明度并不等于要求面向用户的收费标尺与底层的机器物理成本算力标尺完全对等 [43]。AI 软件应当向用户清晰透明地呈现其“完成了哪些具体业务工作(Value)”,而非暴露出用户根本无法掌控和预测的“Token、检索量与重试次数(Cost)”等技术复杂度数据 [42, 43]。
与其他 Source 的呼应或对立点: 该 Source 完美支持了《Can Agents Use a Computer Yet?》中总结出的“企业买家评估和采购智能体时根本不关心后台底层到底跑的是哪款大模型,只在乎任务在限定 SLA 内能否安全可靠地跑完”的实用主义商业心智 [12, 15, 38]。同时,也为应对后台操作过程中由于高频异常报错重试而导致 Token 消耗失控的痛点,提供了科学合理的定价避险解法 [12, 39]。
赛道深度
AI 智能体与计算机使用 (AI Agents & Computer-Use)
赛道概述: 该赛道正从早期的技术演示快速演变为企业级可部署的实用生产力工具 [1, 2]。智能体通过模拟人类操作桌面操作系统(屏幕截图、点击、输入),在没有 API 的 legacy 遗留系统中自动执行标准化的后台工作流,正在对全球传统业务流程外包(BPO)的成本结构和效率产生颠覆性冲击 [3-6]。
各方观点:
- Fabrizio Serafini, Seema Amble, Eric Zhou:指出计算机使用智能体(CUA)在 OSWorld-Verified 桌面基准测试上的最高得分已从一年前的 42% 飙升至当前的 85%(以 Claude Fable 5 为代表),超越了人类测试者约 72% 的表现 [2, 7];这类智能体最适合处理标准化、高重复、无 API 支持且可直接机器观测结果的后台任务(如 CRM 录入、QA、IT 票据处理等) [5];真正的商业壁垒已从最底层的 UI 导航技术,转移到对具体企业专有上下文、权限控制、异常验证、Escalation 以及错误处理流程的掌控 [8, 9]。
- Ben Horowitz, Martin Casado 等:在《The Machine Age Fund》中指出,AI 正在经历从“Chat”向深度“Reasoning”和“Coding”等高强度知识工作的升维,这不仅极大拉高了计算的 Token 强度,也让后台多智能体编排(Orchestration)的复杂度呈数量级上升 [10, 11]。
涉及公司:
- ServiceNow [5]
- SAP [12]
- Mechanize, Habitat, Fleet, Chakra, Deeptune, Matrices, Originator (RL 仿真与训练基建初创公司) [13]
- Standard Intelligence (开发了基于视频训练的 30 FPS 通用计算机操作模型) [14]
投资含义: 在 primary 市场中,纯大模型 API 驱动的智能体已高度商品化,投资机构应重点布局那些能够深耕垂直工作流、具备强大工程化缓存(Caching)平抑算力成本并拥有多智能体编排基础设施的应用层企业。
机器人与具身智能 (Robotics & Embodied AI)
赛道概述: 具身智能致力于构建能够感知、理解 3D 物理空间并与实体世界进行高可靠、高效率物理交互的智能化系统 [15, 16]。当前该赛道的核心瓶颈在于高质量物理交互数据的严重匮乏,而基于大世界模型的“虚实结合(Real-to-Sim-to-Real)”模拟仿真环境正在成为破解数据荒、加速系统迭代的最关键基建 [17, 18]。
各方观点:
- 李飞飞 (Fei-Fei Li):提出“空间智能(Spatial Intelligence)”是 AI 的下一个前沿,即赋予 AI 在物理和虚拟空间中生成、理解、推理和交互的能力 [15, 16];通过将 Scenix 引入 World Labs,双方将利用 Marble 等 3D 大世界模型,通过图像和文本 prompt 生成几何一致的 3D 世界,从根本上解决机器人行业数据短缺的痛点 [18, 19]。
- 李允珠 (Yunzhu Li):强调真实的物理原子移动极其缓慢、危险且成本高昂,模拟仿真(Simulation)是加速测试评估(Evals)的唯一出路 [20];其构建的平台是完全“硬件/具身无关(embodiment-agnostic)”与“模型无关(model-agnostic)”的,允许不同厂商将机器人脑部算法放入高度一致的 3D 数字孪生环境中进行系统性的随机化训练(Randomization) [21-23]。
- Ben Horowitz, Martin Casado 等:表示整个 AI 堆栈在物理世界正遭遇瓶颈,他们不仅通过 Machine Age Fund 积极下注机器人等物理 AI 终端 [11],还在该赛道进行了早期的硬件级和系统级投资 [24]。
涉及公司:
- World Labs [16]
- Scenix [17] (已被 World Labs 收购)
- Mind Robotics [24]
- Skydio [24]
- Waymo [24]
- SpaceX [24, 25]
投资含义: 相比于研发周期长、硬件供应链极其脆弱的单一整机(人形机器人)初创公司,投资更应该向能够支持多硬件、多算法,通过 3D 物理高保真拟真技术提供“虚拟训练场”的通用软件及评估基建厂商倾斜。
AI 物理基础设施、算力与能源 (AI Physical Infrastructure, Compute & Energy)
赛道概述: AI 向推理和知识工作的纵深挺进,带来了订单式暴增的 Token 强度和功耗挑战 [10]。机架级计算密度的极端提升导致 AI 的底层硬件和系统全面撞墙,正在倒逼现代物理散热、高速互联、芯片制造以及国家电网配套基础设施进行全方位的物理级重构 [11, 26]。
各方观点:
- Ben Horowitz, Martin Casado, Raghu Raghuram 等:指出从 NVIDIA H100 升级到 Rubin 机架,计算密度增加了 28 倍,网络连接已逼近铜缆的物理极限,单机架功耗从 5-10 kW 猛增至 100-250 kW,未来 3 年将飙升至 1MW 级别 [27];数据中心集群向百兆瓦及吉瓦(GW)级演进,供电不得不引入表后配电(behind-the-meter)及专属发电源 [27]。为此,a16z 募集了 11 亿美元的 “Machine Age Fund” 专门加速这一物理层面的重构 [10, 28]。
- 李允珠 (Yunzhu Li) & 李飞飞 (Fei-Fei Li):从算力能效比(Performance-to-Power)的角度指出,人类大脑仅消耗 30 瓦就能完成极其复杂的物理导航与智能活动 [29],而现代大模型离人类的超低能效水平还相差甚远,这更加凸显了底层电力、能源和物理软硬件整合系统重构的迫切性。
涉及公司:
- Unconventional AI, Nexthop, Volta, Atoms, Heron Power (均为 a16z 投资的物理算力、高频宽互联、散热与能源类硬件初创公司) [24]
- NVIDIA [27]
投资含义: 算力军备竞赛的超额收益正在向“高密度液体散热、低延迟光网络/新型互联材料、高带宽内存以及表后自备配电与新型清洁能源”等硬件核心环节溢出。
AI 软件定价与商业模式 (AI Software Pricing & Business Models)
赛道概述: 大模型应用的每一次操作都包含复杂的模型调用、检索、多次重试和潜在的失败运行 [30]。由于 AI 应用具备明显的物理算力成本(COGS),软件开发商必须摒弃把产品矮化为“算力代售”的“按 Token 定价”模式,采用能呈现工作价值的 Credits(额度制)或 Outcomes(结果计费)来保护产品毛利 [30-33]。
各方观点:
- Tugce Erten, Sarah Wang:指出 Token 定价将大模型底座的成本波动直接暴露给客户,且在算力大降价的趋势中会导致应用层丧失定价权 [31, 32];企业应推行“收费表(Billing Meter)”与底座“成本表(Cost Meter)”的分离,采用额度制(Credits)让用户根据 recognizable work 的努力带宽(Effort bands)付费 [34, 35];一旦业务结果清晰、可归因,应坚决向 Outcomes 计费靠拢,从而在底层模型降本的过程中,将技术红利安全地沉淀为应用的超额 Gross Margin [33, 36]。
- Fabrizio Serafini, Seema Amble, Eric Zhou:在智能体生产部署分析中指出,智能体在处理长路径业务时若偏离流程,其重复重试会消耗大量 Token [4, 9];应用厂商通过将跑通的路径缓存(Cache)为确定性代码,并在前台采用 Task-based/Hour-based 或 Outcomes 的解耦定价,是规避高昂推理黑盒成本、确保毛利平稳的关键工程手段 [9, 37]。
涉及公司:
- Clay (将 Data Credits 与 Actions 分离,并对昂贵推理模型实行 Token 零markup透传混合计费的商业案例) [38]
- OpenAI [39]
- Stripe [40]
投资含义: 在评估一级和二级市场的 SaaS 公司时,科学合理的商业定价包装(Credits/Outcome 组合设计)已成为决定其能否将 AI 技术浪潮转化为高毛利率、高客户留存与预算可预测性的核心商业分水岭。
公司聚焦
| 公司/项目 | 来源 | 提及次数(粗略) | 上下文(中文) | 情感倾向 | 投资视角解读(中文) |
|---|---|---|---|---|---|
| World Labs | Source 2 | ~18 | World Labs 是一家空间智能与 3D 大世界模型前沿开发初创公司 [1, 2]。 | 看多 | 其高一致性的 3D 几何建模技术是生成创意内容及物理智能体训练的关键基础设施。 |
| Scenix | Source 2 | ~15 | Scenix 开发了 Real-to-Sim-to-Real 的技术管线,通过高度一致的数字孪生环境解决机器人训练和评估的数据瓶颈 [1, 3, 4]。 | 看多 | 解决具身智能最核心的交互数据瓶颈,作为通用训练及评估基建具有极高的卡位价值。 |
| Marble | Source 2 | ~6 | Marble 是 World Labs 开发的底座级 3D 生成式大世界模型,可将单张或多张图像生成 3D 几何空间 [4-6]。 | 看多 | 作为 3D 空间几何与物理的拟真底座,是物理 AI 和机器人大规模虚拟演练的核心乘数。 |
| OpenAI / ChatGPT | Source 1, 4 | ~6 | OpenAI 在 2020 年推出了 API 接口并首创 Token 计费,ChatGPT 掀起了应用层开发浪潮 [7, 8]。 | 中性 | 底层大模型 API 基础能力正在快速商品化和降价,面临应用层厂商的定价脱钩。 |
| SAP | Source 1 | ~5 | 智能体在 SAP 等由于缺失 API 而通常需要人工点击录入的 legacy 遗留系统中,展现出极强的代替作用 [9-12]。 | 中性 | 其庞大的遗留企业 ERP 系统为计算机使用智能体(CUA)提供了最宽阔和最刚需的落地场景。 |
| Cursor | Source 3, 4 | ~5 | a16z 撰文探讨了 Cursor 配合 SpaceXAI 打造的高效迭代研发团队 [13-17]。 | 看多 | 作为 AI 编程辅助工具的领头羊,其通过深度集成工作流极大缩短了企业软件开发生命周期。 |
| Clay | Source 4 | ~4 | 获客数据平台 Clay 通过将数据额度与 Actions 额度分离、透传高波动模型成本来优化其 pricing 模型 [18]。 | 看多 | 其计费表与底层成本表彻底分离的 credits 体系,为 AI 应用层软件在算力巨变中保护毛利提供了标杆范本。 |
| Stripe | Source 1, 3 | ~3 | a16z 探讨了 OpenRouter 与 Stripe 联合构建的智能支付与路由网络 [19-21]。 | 看多 | 在多智能体、多模型频繁交互和动态重试的时代,Stripe 将继续维持其在 AI 微支付账单基建上的垄断地位。 |
| OpenRouter | Source 1, 3 | ~3 | OpenRouter 与 Stripe 联手打造了智能体时代的智能路由和支付体系 [19-21]。 | 看多 | 作为多模型聚合与路由层,OpenRouter 极大降低了应用开发商在模型选择上的锁定风险。 |
| SpaceX | Source 2, 3 | ~3 | a16z 早期投资了 SpaceX,且其团队在使用 AI 开发工具(如 Cursor)实现极速迭代 [13, 14, 22]。 | 看多 | 代表了高壁垒物理重工业与航天赛道,AI 辅助工程设计与制造正显著缩短硬件研发周期。 |
| Exa | Source 4 | ~3 | 探讨了为 AI 智能体建立新型网页搜索引擎的 Exa 公司的技术路径 [15, 23]。 | 看多 | 解决了智能体互联网信息检索(Agentic Search)的痛点,是 AI 原生搜索基础设施的稀缺资产。 |
| Claude (Anthropic) | Source 1 | ~3 | 截至 2026 年,Claude Fable 5 在桌面测试基准 OSWorld-Verified 上以 85% 领跑,超越了人类平均水平 [7, 24]。 | 看多 | 尽管其在大模型和计算机操作(CUA)技术上处于行业顶端,但企业客户最终看重的是其外壳工程与异常自愈。 |
| Waymo | Source 2, 3 | ~2 | a16z 早期投资了 Waymo,且 Waymo 官方表示其高度依赖数十亿小时的虚拟模拟仿真训练 [22, 25]。 | 看多 | 自动驾驶重度依赖虚拟仿真的成功实践,强力印证了 3D 虚拟拟真环境(Sim)在整个机器人赛道的核心价值。 |
| Skydio | Source 3 | ~2 | a16z 于 2016 年领投了无人机公司 Skydio 的 A 轮融资 [22]。 | 看多 | 早期布局的自主机器视觉与特种机器人资产,在当前物理 AI 爆发时代具备极高的稀缺性。 |
| ServiceNow | Source 1 | ~1 | 智能体在处理 ServiceNow 中的 IT 票据等标准化、有明确路径的任务上表现出极强的实用性 [26]。 | 中性 | 传统的企业工作流巨头正面临智能体对底层人工座席的大规模替换,转型为 System of Intelligence 成为关键。 |
| Workday | Source 1 | ~1 | a16z 引用了《Workday's Last Workday?》的标题,暗指传统软件面临的洗牌 [27]。 | 看空 | 传统的“系统记录型(System of Record)”老牌 HR/ERP 软件正在面临 AI 原生交互界面的生死挑战。 |
| Unconventional AI | Source 3 | ~1 | a16z 的 Machine Age Fund 投资了多间硬件公司,包括 Unconventional AI [22]。 | 看多 | 作为物理 AI 算力与系统硬件重构的参与者,在 AI 底层基建升维中具备巨大爆发力。 |
| Nexthop | Source 3 | ~1 | Nexthop 获得了 a16z 近期募集的 Machine Age Fund 的早期投资 [22]。 | 看多 | Rubin 机架时代对铜缆互联物理极限的撞墙,使得 Nexthop 在超高速网络互联技术上具备极高稀缺性。 |
| Volta | Source 3 | ~1 | Volta 是 a16z 新硬件基金近期投资并支持的芯片与算力平台硬件公司之一 [13, 14, 22]。 | 看多 | 随着机架计算密度向吉瓦(GW)级演进,投资将长期向此类底层创新硬科技平台溢出。 |
| Atoms | Source 3 | ~1 | Atoms 获得了 a16z 的 Machine Age Fund 的硬件和系统级投资 [22]。 | 看多 | 聚焦于物理制造与硬件创新,顺应了 founders deal flow 中硬件占比飙升至 20% 以上的趋势。 |
| Heron Power | Source 3 | ~1 | Heron Power 获得了 a16z 硬件专项基金在能源/电力设施重构方向上的早期投资 [22]。 | 看多 | 在未来单机架功耗逼近 1MW 的极致电力密度下,Heron Power 卡位了数据中心自备/表后分布式电力能源的风口。 |
| Mind Robotics | Source 3 | ~1 | Mind Robotics 获得了 a16z 近期设立的 11 亿美元 Machine Age Fund 的投资 [22]。 | 看多 | 专注于物理交互的硬件机器人终端开发,有望与 World Labs 等 3D 虚拟训练软基建产生深度的软硬协同。 |
| Anduril | Source 3 | ~1 | a16z 在 2019 年对国防科技硬件商 Anduril 进行了首笔投资 [22]。 | 看多 | 作为新一代国防科技代表,Anduril 的软件定义硬件和自主 AI 系统在当前地缘政治背景下估值溢价显著。 |
| NVIDIA | Source 3 | ~1 | 引用了 NVIDIA 的 800-V HVDC 架构,用以解决当前 100-250 kW 至未来 1MW 机架的高压输配电挑战 [28]。 | 看多 | Rubin 算力爆发对电力、散热的物理重构,进一步加深了 NVIDIA 在 AI 软硬件与物理工厂系统的生态主宰。 |
| Standard Intelligence | Source 1 | ~1 | Standard Intelligence 基于 1100 万小时视频数据训练了 30 FPS 通用计算机操作模型,用以缩短智能体响应延迟 [29]。 | 看多 | 其基于大规模视频流直接操作计算机 UI 的路线,代表了绕过低效截图循环的潜在下一代智能体交互架构。 |
| Mechanize / Habitat / Fleet / Chakra / Deeptune / Matrices / Originator | Source 1 | ~1 | 这一浪潮中的初创企业,专注于为前沿智能体提供计算机使用的 RL(强化学习)模拟、训练和评估沙盒环境 [30]。 | 看多 | 控制着智能体精度和鲁棒性飞跃的关键数据阀门,是智能体真正实现生产级商用的核心催化剂。 |
| Globalify / HiveDesk / 1840 & Co | Source 1 | ~1 | 引用了 2026 年关于印度海外离岸外包(BPO)劳动力平均价格(~\$10/小时)的参考数据源 [31]。 | 中性 | 传统的离岸外包中介业务正面临每小时 \$6-\$8 推理成本、可 24/7 运转的 CUA 智能体的彻底替代。 |
| Probook | Source 1 | ~1 | a16z 宣布投资了专注于 B2B 垂直业务软件的初创公司 Probook [10-12]。 | 看多 | 在企业软件面临 AI 智能化洗牌的交界期,能深度扎根企业专有上下文和 tribal knowledge 的垂直应用依然能获得高估值。 |
| Tessera Labs | Source 1 | ~1 | a16z 宣布投资了企业应用初创公司 Tessera Labs [10-12]。 | 看多 | 显示出顶尖机构正继续向能够高阶编排并释放 AI 应用价值的底层中间件和垂直软件下注。 |
| Gemini (Google) | Source 1 | ~1 | Gemini 3.5 Flash 仅被用作内部研究评测,由于没有原生的计算机使用功能,未被列入真实桌面测试基准 [24]。 | 中性 | 尽管在多模态大底座实力雄厚,但在高可用智能体原生执行层的工程化和功能释放上进度有待加速。 |
| Roomba | Source 2 | ~1 | 提及扫地机器人 Roomba 尽管作为早期机器人,其系统也高度依赖模型从模拟仿真中向真实世界的迁移 [32]。 | 中性 | 验证了模拟仿真(Sim)不仅适用于顶尖人形硬件,更是任何大规模物理终端控制必不可少的工程基石。 |
| Intel | Source 3 | ~1 | a16z 硬件投资合伙人 Guido Appenzeller 曾担任 Intel 数据中心事业部(DPG)的 CTO [33]。 | 中性 | 老牌芯片巨头的资深硬件与软硬一体人才流向风投,将显著加速 AI 物理基础设施重构的项目流筛选与孵化。 |
| Tencent | Source 2 | ~1 | 提及 Scenix 的联合技术创始人 Changi Jan 拥有在腾讯(Tencent)和 Weta 的特效研发与创业经历 [34]。 | 中性 | 游戏与影视特效巨头沉淀的 3D 渲染与物理仿真顶尖人才,正在向具身智能的物理引擎赛道进行技术溢出。 |
| Weta | Source 2 | ~1 | 提及技术创始人 Changi Jan 曾在 Weta(维塔数码)工作的特效背景 [34]。 | 中性 | 顶级视觉特效公司的 3D 渲染与仿真资产,是构建高一致性 AI 仿真数字孪生的重要技术积淀。 |
💡 投资建议:当前 AI 产业估值的逻辑已发生根本变化:应用层正从“按 Token 计费”的代理人模式向“按 Credits / Outcomes”高毛利商业模式演进,纯模型 API 壁垒消退;而物理世界中,“高密度算力/网络/散热/能源硬件”及“Real-to-Sim 物理仿真训练平台”正在成为承接万亿资金重构物理 AI 底座的硬核黄金赛道。
2026 具体预测
AI 智能体 (AI Agents)
本主题探讨计算机使用智能体(Computer-Use Agents, CUA)在企业环境中的部署路径、未来技术演进方向,以及随之而来的多智能体编排基础设施的兴起。
- [Fabrizio Serafini, Seema Amble, Eric Zhou]:预测计算机使用智能体的下一波浪潮是将它们真正无感、可靠地部署到具体企业中 [1]。随着基础 UI 导航能力在模型层彻底商品化,智能体的竞争壁垒将向上迁移到上下文、权限控制、业务流程知识、输出验证和异常错误处理等外壳工程层 [1]。
- 可能影响:初创企业和企业买家将不再过度关注底层模型的性能评测排名,转而将研发资金与采购预算倾斜于拥有深度行业工作流整合与高可用错误自愈体系的应用层。
- 看点 / 验证锚点:市场上出现主打“企业专有上下文与工作流安全合规集成”而非“模型排行榜跑分”的标志性智能体应用巨头。
- [Fabrizio Serafini, Seema Amble, Eric Zhou]:预测随着业务流程复杂化和延迟限制收紧,单智能体系统将向多智能体架构(Multi-agent architectures)演进,未来将出现一个类似 Claude Code 的标准化抽象编排框架,以解决当前行业普遍依赖 Bespoke(定制化)复杂编排的痛点 [2]。
- 可能影响:多智能体协调、并行任务分解与长程记忆管理将诞生出独立的高价值软件基础设施赛道。
- 看点 / 验证锚点:主流开源社区或大模型实验室发布被行业广泛采纳的、可一键抽象复杂多智能体协同的技术脚手架或编排标准。
- [Fabrizio Serafini, Seema Amble, Eric Zhou]:预测未来智能体的发展将主要围绕准确性、延迟和成本三条主线展开 [3]。其中,延迟将通过直接基于 accessibility tree(可达性树/DOM)而非逐张截屏来显著缩减,而成本将通过更便宜、更小的非前沿模型承接 Routine 点击动作来大幅走低 [3]。
- 可能影响:智能体的运行成本将进一步低于离岸 BPO 劳动力,且实时、高频的自动化桌面操作将成为商业常态。
- 看点 / 验证锚点:类似 Standard Intelligence 训练的 30 FPS 高帧率通用计算机动作模型在企业生产环境中实现低延迟商用。
算力与能源 (Compute & Energy)
本主题关注随着 AI 向深度推理和代码生成等知识工作纵深演进,其对机架计算密度、全球供应链及数据中心高压输电与电力能效产生的物理撞墙挑战。
- [Ben Horowitz, Martin Casado, Raghu Raghuram, David Ulevitch, David George]:预测单机架的电力功耗在未来 3 年内将从目前的 100-250 kW 增加到 1MW(兆瓦)级别,数据中心集群也将朝着吉瓦(GW)级园区狂飙 [4]。
- 可能影响:传统公共电网无法支撑如此恐怖的电力密度暴增,倒逼算力园区全面转向表后配电(behind-the-meter)及直接配套自备发电源。
- 看点 / 验证锚点:首个单机架功耗达 1MW、配有专属核能或表后分布式清洁能源系统的 GW 级超级算力中心宣布动工或投产。
- [Ben Horowitz, Martin Casado, Raghu Raghuram, David Ulevitch, David George]:预测长期维持在每年 20% 到 30% 增长上限的物理硬件行业供应链,将在强劲需求的逼迫下迅速发生改变,以适应三位数的 triple-digit 爆发式增长 [5]。
- 可能影响:高频宽内存(HBM)、先进光纤互联、新型高密度散热及新材料供应链将迎来万亿级的资本开支和技术瓶颈突破。
- 看点 / 验证锚点:核心物理 AI 硬件(芯片、高速网络及散热系统)初创企业的季度营收与出货量同比呈现 100% 以上的持续爆发。
机器人与具身智能 (Robotics & Embodied AI)
本主题涉及机器人在物理世界中的商业化落地路径、基于 Real-to-Sim-to-Real 的高保真 3D 虚拟拟真环境构建,以及机器人达成人类级别能效和泛化能力的长期预期。
- [Yunzhu Li]:预测机器人要达到人类级别的物理能效(如人脑仅消耗 30 瓦就能进行复杂导航与操作)和全面多任务泛化能力,将需要“非常长的时间(a very long time)”,但其底层算法生态的迭代和 moving pieces 的合拢速度将持续超出预期 [6-8]。
- 可能影响:一级和二级市场将调低对“全能通用人形机器人短期进入千家万户”的过热预期,转而理性评估。
- 看点 / 验证锚点:2027-2028 年人形机器人在全 unstructured 家庭场景中(如遛狗、非规则内务整理)的实际渗透率和商业出货数据。
- [Yunzhu Li]:预测机器人的商业推广和鲁棒性验证将采取渐进、可持续的理性路径,即率先在半结构化环境(Semi-structured environments,如仓库、餐厅、酒店、电子装配厂等)中取得绝对成功,然后再向完全无结构的物理家庭环境推进 [9, 10]。
- 可能影响:深耕特定工业装配线、仓储物流搬运或标准化清洁等垂直半结构场景的细分机器人整机和软硬件厂商将率先实现健康的商业造血。
- 看点 / 验证锚点:主流代工厂或智慧仓储巨头的半结构化机器人劳动力渗透率在 2027 年实现数量级提升。
- [Fei-Fei Li]:预测在未来两年内(至 2028 年左右),World Labs 与 Scenix 联合打造的 3D 生成与 Sim 物理拟真基础设施将在少数几个重要的垂直使用场景中拥有经过验证的灯塔客户(lighthouse customers),并利用这些成功标杆来向整个行业规模化推广其系统 [11]。
- 可能影响:Real-to-Sim-to-Real 流程被机器人工业界公认为唯一行之有效的高效训练与测试评估(Evals)标准,彻底确立其软件基础设施的卡位优势。
- 看点 / 验证锚点:World Labs 官方在未来 12-24 个月内对外披露其首批部署于实际电子装配或仓储流水线的“灯塔级客户”名单。
市场、定价与经济 (Market, Pricing & Economy)
本主题聚焦于 AI 应用软件从“按 Token 计费”向“Credits / Outcomes”高毛利商业模式演进的定价重塑,以及 2026 年宏观科技行业的整合与并购浪潮。
- [Tugce Erten, Sarah Wang]:预测随着业务结果变得清晰且可归因,大量 AI 应用软件商将全面重构其定价体系,抛弃矮化产品价值的 Token 计费,演进为混合商业模式:通过席位收准入费、通过 Credits(额度制)收变动工作费,对昂贵且高波动推理模型进行 Token 零加价透传,并在结果明确时直接收取 Outcomes(结果/成效)服务费 [12, 13]。
- 可能影响:AI 应用开发商得以将底层算力不断降价的红利完全转化为自身的超额留存毛利(Gross Margin),软件行业重新树立起高毛利、高确定性的 SaaS 2.0 护城河。
- 看点 / 验证锚点:2026-2027 年 AI 原生应用(如法律、营销、客服等垂直代理)公开定价单中“按 Credits”或“按成效付费(Outcome-based)”商业合同的市占率上升。
- [David Haber](注:引用自 recommended posts 标题):预测 2026 年将成为历史上规模最大的并购(M&A)年 [14]。
- 可能影响:大批无法建立高毛利商业闭环、面临 Token 物理成本挤压的中小 AI 应用初创公司被传统软件帝国(如 ServiceNow, SAP, Salesforce)加速并购,行业集中度空前提高。
- 看点 / 验证锚点:第三方金融机构在 2026 年底统计的科技和软件行业年度 M&A 并购总交易金额和案例数量创下历史最高纪录。
反共识观点
1. AI 应用层定价必须与底层 Token 彻底脱钩,转化为按价值/结果计费
- 观点本身:AI 应用层公司不应采用按 Token 计费或简单的“成本加成 Token”额度定价,而必须将定价锚定在用户能直观理解的工作价值(如 Credits 额度)或可归因的商业结果(Outcomes)上 [1-3]。将定价绑定在 Token 上是把模型商的物理成本转嫁给客户,并将自身商业价值锁死在不断暴跌的算力曲线上 [2, 4]。
- 说话人 + source:Tugce Erten, Sarah Wang《You are not a model. Don't price per token. | Andreessen Horowitz》[1, 5, 6]
- 主流共识是什么:由于 OpenAI 等大模型实验室首创并普及了 API 的 Token 计费标准,行业普遍认为 AI 原生软件也应该采用高度透明、实报实销的 Token 计费或将 Token 成本简单换算为应用层额度的成本加成定价法 [3, 7, 8]。
- 如果这个观点正确,对投资意味着什么:一级市场投资人应避开那些仅靠代售 Token 算力的套壳应用,重点布局能够利用 credits 建立“收费标尺”与“物理算力标尺”解耦的软件公司 [9, 10]。随着底层模型成本大幅下降,这类解耦定价的公司能将全部降本红利转化为自身高额的留存毛利(Gross Margin) [10]。
2. 计算机使用智能体(CUA)在数字交互中的执行速度远慢于人类
- 观点本身:在当前的实际生产部署中,利用前沿大模型以屏幕截图和点击方式操作 UI 的智能体,其单次任务执行速度远远落后于人类 [11]。人类在两到三分钟内就能完成的系统录入工作,智能体在“智能体模式(agentic mode)”下通常需要花八到十分钟才能跑完 [11]。
- 说话人 + source:Fabrizio Serafini, Seema Amble, Eric Zhou《Can Agents Use a Computer Yet? We've Got the Data | Andreessen Horowitz》[11, 12]
- 主流共识是什么:AI 拥有“超人级(super-human)”的处理速度,一旦部署智能体,企业的数字化工作流将获得几倍甚至几十倍的瞬时速度和执行效率提升。
- 如果这个观点正确,对投资意味着什么:评估 BPO(业务流程外包)替代型初创公司时,投资人不应过度苛求其单次交互的执行速度,而应将评估核心转向智能体 24/7 不间断运行、无招聘培训摩擦以及业务高峰期瞬间弹性扩容的综合经济 ROI [11]。
3. 具身智能的终局突破依赖高保真 3D 模拟仿真,纯视频预测模型无法提供有效训练
- 观点本身:很多基于大规模真实视频数据集进行端到端预测训练的机器人模型存在致命缺陷——由于缺乏几何和空间一致性,视频预测中经常出现“物体被机器人推开后魔法般消失”等反物理现象,这无法为机器人提供有效的动作学习信号 [13]。具身智能的鲁棒性必须通过高保真 3D 物理模拟仿真(Sim)进行状态空间随机化覆盖以及“反事实推理(Counterfactual Reasoning)”来解决 [14, 15]。
- 说话人 + source:Yunzhu Li, Fei-Fei Li《Fei-Fei Li is Solving the Hardest Problem in Robotics | World Labs with a16z》[13, 14, 16]
- 主流共识是什么:模拟仿真世界由于存在无法跨越的“虚实差距(sim-to-real gap)”,其训练效果大打折扣;机器人自主学习应当走纯真实世界视频学习(Video-only prediction)或完全依赖物理世界真实数据采集(Real-world data only)的路线 [17, 18]。
- 如果这个观点正确,对投资意味着什么:这表明机器人赛道的超额价值将高度向提供“Real-to-Sim-to-Real”高保真模拟训练场和评估(Evals)系统的“模型/硬件双无关(model/embodiment agnostic)”软件基础设施服务商沉淀,而非单纯投资于制造物理实体、依赖极低效的人工遥操作采集数据的硬件整机初创公司 [15, 19, 20]。
4. 智能体最核心的企业买家不关心、甚至不知道跑在底座上的是哪款大模型
- 观点本身:对于每月在生产环境中实际运行数百万个自动化任务的顶级企业买家而言,底层究竟使用的是哪一家大底座模型根本不重要,他们甚至从未去了解过 [21, 22]。底层模型已被抽象并高度商品化,买家愿意付费和评估的核心是包夹在模型外围的高可用工程外壳(如 VM 隔离沙盒、路径缓存、异常自愈及多智能体编排) [22-24]。
- 说话人 + source:Fabrizio Serafini, Seema Amble, Eric Zhou《Can Agents Use a Computer Yet? We've Got the Data | Andreessen Horowitz》[12, 21]
- 主流共识是什么:大模型实验室的基准跑分和模型排行榜(Leaderboards)是决定 AI 智能体产品竞争力和商业化成败的关键护城河,企业买家高度关注并追逐最前沿、跑分最高的模型。
- 如果这个观点正确,对投资意味着什么:投资人应大幅降低对“自研更优大底座模型”这一技术故事的估值溢价,转向投资那些能够用低成本、非前沿模型甚至开源模型构建起极高可用性外围工程闭环的应用和中间件公司 [22, 25, 26]。
5. 人形(Humanoid)并不是解决物理世界 menial 任务的最佳且最经济的硬件构型
- 观点本身:人类的双腿和双手是生物进化为了在完全无结构(unstructured)自然环境中生存而妥协出的“通用但并非在单一任务上最完美”的解法 [27, 28]。从商业和务实的工业部署角度看,直接去攻克无结构家庭场景以及模仿人体结构的通用人形硬件是极难实现商业闭环的,机器人产业应该优先采用更专用的身体构型(specialized body)去深耕仓库、实验室等半结构化环境(semi-structured) [27-29]。
- 说话人 + source:Yunzhu Li《Fei-Fei Li is Solving the Hardest Problem in Robotics | World Labs with a16z》[16, 28, 29]
- 主流共识是什么:制造出和人类外观结构一模一样、拥有双足和灵巧五指的通用人形机器人(Humanoid Robot),是替代人类 minimum-wage 体力劳动的最直接、最核心的商业终局。
- 如果这个观点正确,对投资意味着什么:投资机构应警惕市场上估值过热的通用人形机器人硬件泡沫,将投资策略理性聚焦于面向半结构化工业场景(如电子装配、仓储物流)的“特种结构机器人”以及跨硬件平台的通用运动控制算法软件层 [28-30]。
6. 企业财务透明度要求并不代表“收费标尺”与底层的“物理成本标尺”必须一致
- 观点本身:企业财务在采购 AI 软件时提出的“预测性”与“透明度”诉求,完全不需要通过把底层的物理计费细节(如 Token 消耗、检索调用数、API 重试次数)直接裸露在账单上来解决 [9, 31]。只要能向客户透明呈现已完成的可识别业务价值,底层极其复杂的算力物理解耦成本完全应该由软件商封装在后台 [31, 32]。
- 说话人 + source:Tugce Erten, Sarah Wang《You are not a model. Don't price per token. | Andreessen Horowitz》[1, 9]
- 主流共识是什么:企业 B2B 采购极其厌恶不透明和不可预测的费用,为了消除买家对 AI 账单的“黑盒焦虑”,软件商必须将底层每次运行的真实 Token 成本完全透明、对等地展现在用户的计费账单中。
- 如果这个观点正确,对投资意味着什么:软件开发商不应在账单上用复杂的底层技术参数去训练和折磨客户 [3, 8]。投资人应当指导 portfolio 团队,通过将复杂的算力开销转化为几档简单、直观的“工作量努力带宽(Effort bands)”Credits,既消除了采购摩擦,又留存了定价自主权 [10, 32]。
🤖 下一阶段投资线索:既然纯模型能力的排行榜神话已经破灭,您是否想深入探讨那些能将“计费计量表(Billing Meter)”与底层“成本计量表(Cost Meter)”完美切分,并在 2026 年实现 80% 以上惊人毛利率的应用层企业(如获客平台 Clay [33])的收费机制与产品架构设计?
金句摘录
💡 AI 定价与商业模式 (AI Pricing & Business Models)
"When an application prices that work in tokens, it imports the model provider's cost structure into the relationship with the customer and anchors the product's value to a unit whose cost keeps falling." — Tugce Erten & Sarah Wang (You are not a model. Don't price per token.)
中文解读: 这句话一针见血地指出了当前大量 AI 应用层公司在商业化策略上的深层误区 [1, 2]。将收费标尺与底层大模型厂商的物理消耗单位(Token)直接挂钩,不仅抹杀了应用在专有数据整合、复杂工作流编排等层面的增值价值,更会将公司的商业估值和利润空间锁死在一条注定由于算力竞争和技术迭代而不断暴跌的成本斜率上 [1, 3]。它深刻地警示投资人,优秀的 AI 软件必须在定价心智上与“模型算力代售商”划清界限。
"Instead, we believe companies should price at the highest layer of value that they can reliably measure, attribute, and defend." — Tugce Erten & Sarah Wang (You are not a model. Don't price per token.)
中文解读: 这给出了 AI 时代应用层公司定价重塑的最高行为准则 [2]。它隐含了商业防御力的本质判断:企业交付的价值层级越高(从 API 调用的 tokens 走向任务量的 credits,再到终极业务结果的 outcomes),客户支付的摩擦力就越低,软件自身的护城河也就越牢固 [2, 3]。如果产品的业务结果能够实现清晰、可量化的归因(如成功追回的款项、通过验证的合格销售线索),就应当坚决向按 Outcome(结果)收费转变,这能让软件厂商安全留存技术红利 [2, 4]。
"Transparency does not require the billing meter and the underlying cost meter to be the same." — Tugce Erten & Sarah Wang (You are not a model. Don't price per token.)
中文解读: 这是一个极具洞察力的定价解法。企业财务在采购 AI 软件时所要求的“可预测性”与“透明度”,完全不需要通过把底层的物理计费细节(如 Token 消耗、检索调用、API 重试次数)裸露在账单上来解决 [5]。通过在前台使用直观、易懂的 Credits(额度制)来表达工作价值(例如一次 bug 修复或一份报告),而在后台用工程缓存和模型路由来平抑运行成本,应用层公司可以在消除客户采购摩擦的同时,将底层大模型技术降价带来的所有红利悄无声息地沉淀为自身高额的留存利润 [5-7]。
"In AI applications, every user can generate inference, retrieval, search, tool calls, third-party data, media generation, retries, and failed runs. Fast growth can hide a weak business if each new dollar of revenue is quickly paid back to model, cloud, or data providers." — Tugce Erten & Sarah Wang (You are not a model. Don't price per token.)
中文解读: 这是对 AI 软件服务商盲目追求 ARR 扩张策略的严厉警告。与几乎零边际成本的传统 SaaS 不同,AI 应用由于伴随着大量的多模型路由、信息检索和出错重试,具有极为明显的物理算力成本(COGS)[8]。如果应用商只关注表面的用户高增速,而没有建立强壮的商业收费与底层成本隔离的定价屏障,高额的物理运行开销很快就会吞噬掉辛苦赚来的每一点营收。这使得投资人在评估项目时,必须把 COGS 的精细化工程控制和缓存机制提至战略核心地位。
🤖 AI 智能体与企业部署 (AI Agents & Enterprise Deployment)
"Bottom line: when your heaviest users stop checking the leaderboard, the leaderboard has stopped being the story." — Fabrizio Serafini, Seema Amble, and Eric Zhou (Can Agents Use a Computer Yet?)
中文解读: 这一妙喻宣告了 AI 智能体技术已经正式完成从“科研实验室的刷分 Demo”向“工业级生产部署”的惊人跨越 [9, 10]。当重度使用智能体自动化任务的企业客户不再关心各大模型在学术基准排行榜(Leaderboards)上的零点几分的技术差距时,说明底层模型作为硬件底座已经实现了高度商品化与无感置换 [10]。这标志着商业主战场已彻底转移,决定成败的是谁能把大模型包夹在实用的工程外壳中,解决现实生产中残缺的业务流程和异常错误 [10, 11]。
"As raw UI navigation becomes a model-layer commodity, the model is no longer the main bottleneck and the durable advantage moves up the stack: context, permissions, process knowledge, validation, escalation, error handling, caching..." — Fabrizio Serafini, Seema Amble, and Eric Zhou (Can Agents Use a Computer Yet?)
中文解读: 这段话精准界定了当前 AI 智能体(Agents)领域的真实壁垒边界 [12]。仅靠 Selenium 或 UI 截图导航等“点击和输入”的基础交互能力(Execution layer)正被模型底座快速抽象并商品化,失去其原有的护城河属性 [12, 13]。真正的、无法被跨越的持久竞争优势正在向应用层和上下文层迁移——即特定组织和企业的“部落知识”(tribal knowledge)、权限配置、业务规范(runbooks)、错误重试策略以及深度适配具体客户工作流的行业Know-how [12, 14]。
"Where before deterministic code simply failed, or a human had to review and fix every break, here the agent absorbs that uncertainty on its own. It's one way of designing for failure, and it shows what buyers are actually rewarding and using at scale." — Fabrizio Serafini, Seema Amble, and Eric Zhou (Can Agents Use a Computer Yet?)
中文解读: 这道出了智能体技术在长尾业务流程自动化中展现出惊人生命力的技术本质 [15, 16]。传统的、依赖规则编写的确定性代码网络极其 brittle(脆弱),面对零售商或银行系统界面一丁点的更新就会直接报错罢工 [16, 17];而现代智能体的高级部署架构在遇到未定义路径时,能充当一个自愈、诊断并重新缓存代码的中间件,自主在后台吸收“未知和异常” [16]。这种“面向故障设计(design for failure)”的抗波动工程弹性,才是当前企业买家最愿意投入数百万美元、在实际生产中委以重任的原因 [16, 18]。
"In agentic mode, agents are still slower than people, and it is not close – a task someone finishes in two to three minutes can take an agent eight to ten... Deterministic runs flip this... but for the agentic work the argument is not speed. It is that an agent runs around the clock, costs a fraction of US labor, and scales without hiring." — Fabrizio Serafini, Seema Amble, and Eric Zhou (Can Agents Use a Computer Yet?)
中文解读: 这个实测数据客观打破了“AI 速度快于人类”的盲目共识,具有极强的认知对齐意义 [19]。它表明,在操作电脑桌面、处理极其复杂的视觉截图反馈和多步交互时,智能体的执行速度在物理时间上依然明显落后于人脑 [19]。然而,智能体的底层经济算盘根本不需要依靠“单次速度”来算清:通过 24/7 不眠不休地不间断运转、极低廉的 inference 推理折合时薪,以及在面临业务突增时瞬间复制千万个实例的无摩擦扩展弹性,智能体在综合 ROI 上已经完全击穿了传统人工劳动力 [19, 20]。
⚡ 算力、电力与物理基础设施 (Compute, Power & Infrastructure)
"And as we evolve from chat to reasoning to coding and other forms of knowledge work, both the demand for work and the token intensity of the work increase by orders of magnitude. Machine intelligence is going vertical." — Ben Horowitz, Martin Casado, et al. (The Machine Age Fund)
中文解读: 这句话深刻提示了 AI 产业从“娱乐化玩具”向“高壁垒产业工具”转变时,对物理底座能源与算力需求的暴烈升级 [21]。当 AI 模型由简单的单轮对话(Chat)向逻辑推理、工程级代码生成(Coding)以及复杂的垂直行业分析演进时,其单次交互背后的思考链路(如推理模型的思维链、复杂的 retries 与 self-heal 循环)对算力 token 的消耗密度正在呈几何级数(orders of magnitude)向上狂飙 [18, 19, 21]。它强力支撑了 a16z 募集 11 亿美元建立新基金、对全球 AI 物理底座进行大范围重构的投资逻辑 [21, 22]。
"Rack power moved from roughly 5-10 kW to 100-250 kW to support today's systems and will increase to 1MW over the next 3 years." — Ben Horowitz, Martin Casado, et al. (The Machine Age Fund)
中文解读: 这是一组极具震慑力的热物理与能效数据,生动勾勒出了 AI 算力军备竞赛由于过度压榨芯片性能而猛烈撞击现代输变电和散热系统物理极限的残酷现状 [22, 23]。单机架从早期的 10 千瓦狂飙至 100-250 千瓦,乃至未来 3 年预计高达 1 兆瓦(1MW)功耗的宏观趋势,意味着传统依靠公共电网直配和传统机房风冷冷却的架构已经走到了尽头 [23, 24]。高密度散热液体、新型高压输变电(如 800-V HVDC)以及直接配套数据中心的“表后配电”自备清洁发电源将爆发性成为未来的万亿级高壁垒硬件战场 [23, 24]。
🤖 具身智能与 3D 虚拟仿真 (Robotics & Simulation)
"There's a very important role simulation plays that real world data doesn't play which is counterfactual reasoning." — Fei-Fei Li (Fei-Fei Li video)
中文解读: 李飞飞在这里提出了仿真世界之于机器人训练最关键、最不可替代的终极核心价值:反事实推理 [25, 26]。真实物理世界的数据采集中规中矩且极度稀缺,但决定一个具身智能系统能否在工业场景安全部署的生死瓶颈,是它在面对“现实中从未发生、或不被允许在现实中主动演练的极限灾难与危机场景”时的应急控制力 [26-28]。高精度的 3D Sim 模拟训练场提供了唯一的安全环境,允许机器人在脑海中进行成千上万次灾难情境的“反事实”推演和自愈自纠,从而获得了无与伦比的安全鲁棒性 [26, 28]。
"If you're thinking about where does the robustness coming from robustness coming from a sufficient coverage of the scenarios that robots might encounter... focus more on the semiructured environments before we move on to fully unstructured environments" — Yunzhu Li (Fei-Fei Li video)
中文解读: 这是一个极具清醒商业心智和现实主义科学观的反共识商业判断 [29, 30]。面对当前全球产业资本对“人形机器人进入杂乱、不可控的家庭物理空间(完全无结构场景)”的技术狂热和超前预期,李允珠冷静指出,具身智能的系统鲁棒性建立在“对状态空间覆盖度的绝对广度”上 [29, 31]。率先在半结构化场景(如仓库搬运、电子车间装配、实验室操作等环境相对可控、动作边界可被逻辑校对的环境)取得彻底成功并实现商业化造血,才是机器人产业迈向终极 unstructured 环境的最务实、最健康的跳板 [29, 31]。
🤖 下一阶段研究:如果您想进一步探讨,这些前沿机构是如何在 2026 年利用例如 World Labs 研发的 3D 生成式 Marble 底座模型来实现“Real-to-Sim-to-Real”高精度数字孪生重建 [27, 32],并以此彻底解决机器人行业长期面临的“数据卡脖子”瓶颈,我非常乐意为您深度剖析!
投资信号
融资与押注(具体公司、轮次、领投方)
- a16z 为其最新的硬件与物理 AI 专项基金“Machine Age Fund”募集了 11 亿美元资金 [1]:该基金于 2026 年 8 月底宣布,旨在全力加速 AI 芯片、高频宽内存、高速网络互联、高密度存储、冷却材料、电力能源以及机器人等物理基础设施的建设 [2-4]。
- 中文投资视角解读:顶级风投机构设立 10 亿级别巨额专项硬件基金,标志着资本市场已达成明确共识——AI 的主战场已从纯软件算法向重资本、重供应链的物理层基建大步转移。
- 空间智能前沿底座模型实验室 World Labs 正式收购机器人模拟仿真初创公司 Scenix [5-7]:该收购在 2026 年由 World Labs 推出 Marble 生成式 3D 空间底座模型(于 2025 年底发布 [6])之后达成,旨在通过 Scenix 的 Real-to-Sim-to-Real 技术管线解决机器人行业训练和评估(Evals)数据极度匮乏的瓶颈 [8, 9]。
- 中文投资视角解读:这是一起典型的“技术加人才型”战略并购,表明在具身智能领域,掌握“3D 物理拟真(Sim)”等数据生成工具的软基建厂商正在成为头部大模型实验室重金争夺的黄金资产。
- a16z 近期集中下注了 6 家物理硬件及机器人初创企业 [10]:这些新投资的具体公司包括 Unconventional AI、Nexthop(超高速网络互联)、Volta(芯片与算力平台)、Atoms(物理制造)、Heron Power(分布式电力与能源)以及 Mind Robotics(物理机器人硬件)。
- 中文投资视角解读:这些被投企业覆盖了电网能源、光电互联、高密度芯片和物理终端,为一级市场提供了明确的“AI 硬件全栈物理重构”投资风向标。
- a16z 历史上的早期硬科技标杆投资节点曝光 [10]:包括 2016 年领投无人机公司 Skydio 的 A 轮融资、投资航天巨头 SpaceX、2019 年首笔下注 Anduril,以及 2020 年作为首批创投机构参与 Waymo 的融资。
- 中文投资视角解读:这些历经多年的长周期硬件与国家安全(American Dynamism)项目如今已成为百亿乃至千亿级巨头,证明了硬科技长线投资在当前收获期能带来极高的资本回报与行业统治力。
- a16z 在应用层下注 B2B 垂直业务软件 Probook 和 Tessera Labs [11, 12]:这两个项目由 Seema Amble、Eric Zhou 等应用层合伙人推进,显示其继续在软件层深耕垂直上下文与企业专有 tribal knowledge [13]。
- 中文投资视角解读:在一级市场中,不能仅投底层模型,能将大模型封装并深植于具体行业工作流中的垂直 SaaS 标的仍然是获取稳健 ARR 增长的首选。
市场时机与 IPO(哪些公司可能上市,时间窗口)
- David Haber 预测 2026 年可能成为“历史上规模最大的并购(M&A)之年” [14]:由于大批无法建立高毛利率商业闭环、面临 Token 推理成本挤压的中小 AI 应用初创公司寻求退出,行业正在发生大规模集中化整合。
- 中文投资视角解读:这意味着二级市场和传统软件巨头(如 SAP、ServiceNow)将迎来以相对便宜的估值吞噬 AI 原生创新资产的绝佳买方窗口期,而非盲目等待 IPO 退出。
- World Labs 设定 2 年内(至 2028 年左右)实现“灯塔客户(Lighthouse Customers)”商业化验证的窗口期 [15]:Fei-Fei Li 明确指出,其 3D 生成与 Sim 仿真软基建的完美成功指标是在两年内,在少数关键垂直行业(如仓库、电子装配等)落地并验证客户自动化需求 [16],并以此作为向全行业复制的标杆。
- 中文投资视角解读:这为具身智能软件基建赛道锚定了一个 24 个月的关键业绩兑现窗口,投资者应在此时间点密切追踪其在电子装配或仓储物流领域的实际产线渗透率。
- 后期创业投资回归“成熟/后期创始人(Late Stage Founders)”逻辑 [17, 18]:David George 撰文指出当前 2026 年的后期风投(Late Stage Venture)正高度向具备高资本效率、有实际产业造血能力的成熟创始人集中。
- 中文投资视角解读:由于狂热的估值泡沫出清,后期资本已不再为单纯的“故事与 Demo”买单,Pre-IPO 阶段的投资人应严苛审查标的是否具备健康的 Gross Margin 与强有力的客群粘性。
行业轮动(资金从哪个赛道流向哪个赛道)
- 资金从“纯软件/算法”大举流向“硬科技与物理基础设施” [10]:过去两年中,硬件初创公司在 a16z 整体项目源(Deal Flow)中的比例已从极低水平剧增至 20% 以上,展现出极强的资金吸纳能力。
- 中文投资视角解读:在一级市场,单纯讲“微调开源模型”的软件故事已很难募集资金,资本正在向高能效散热、高带宽内存和表后分布式电网等物理硬件赛道进行系统性轮动。
- 应用层定价从“按 Token 计费”向“Credits(额度)/ Outcomes(结果)解耦计费”模式轮动 [19, 20]:在对 50 位企业技术买家的调查中,27 人偏好 Credits 额度,仅 14 人偏好 Tokens。应用层软件(如 2026 年 Clay 价格重构 [21])正全面将收费标尺与底层大模型物理成本解耦。
- 中文投资视角解读:在 SaaS 2.0 评估中,资金正在抛弃那些将自身价值矮化为“代售底层算力”的公司,优先流入通过 credits 锁死高毛利、并在底层模型大降价时能全额留存利润红利的企业。
- 数亿美元资金涌入计算机使用(Computer-Use)的强化学习(RL)仿真、训练与评估基建沙盒 [22]:资金在过去一年中高度流向 Mechanize、Habitat、Fleet、Chakra、Deeptune、Matrices 和 Originator 等训练基建初创公司。
- 中文投资视角解读:这表明智能体赛道的第一阶段“比拼模型原生执行力”已宣告结束,资金正在向决定智能体在企业复杂环境运行精度、安全隔离和鲁棒性测试的“评测与训练沙盒”方向集结。
- 企业运营预算从传统人力 BPO(业务流程外包)向计算机使用智能体(CUA)轮动 [23, 24]:2026 年最新数据显示,企业在后台人工录入、CRM 更新等场景中,正用折合时薪仅 \$6-8(最低至 \$3)的 CUA 智能体,替代时薪 \$10 的印度离岸 BPO 劳动力或时薪 \$30-45 的美国后台员工。
- 中文投资视角解读:这是一个确定性极强的行业预算大腾挪,涉及万亿级的全球外包劳动力市场,投资者应做空依赖纯人力的传统外包中介,做多拥有高工程可用性的智能体集成平台。
基础设施与经济(算力、能源、半导体的具体数据)
- 单机架计算密度与功耗指标呈 28 倍以上的极限狂飙 [25]:从 H100 机架跨越到 Rubin 机架,单机架计算密度提升了 28 倍, rack power 从 5-10 kW 猛增至 100-250 kW,并预计在未来 3 年内暴增至 1MW(1,000 kW)。
- 中文投资视角解读:这意味着传统的机房风冷和常规电网配套已经完全过载,单机架 1MW 时代的到来将对高密度液冷技术和输配电新材料(如 800-V HVDC 架构)带来物理级的爆发式需求。
- 数据中心规模跨入 GW(吉瓦)级时代,电力供应向 behind-the-meter(表后配电)自备能源演进 [25]:算力园区正从十兆瓦级向百兆瓦及吉瓦级演进,供电模式从纯公共电网直配,向配有 captive sources(自备专用发电源)及表后配电的分布式清洁能源系统(如核能、天然气)演进。
- 中文投资视角解读:电力指标已成为决定 AI 算力集群能否按期交付的最关键、最具排他性的物理资源,手握表后配电方案或专属清洁能源供给的初创企业具有极高的投资溢价。
- 物理硬件供应链遭遇 triple-digit(三位数,即 >100%)的爆发式需求挤压 [3]:相较于物理供应链传统的年增长率上限(20% 到 30%),AI 基础设施对高频宽内存(HBM)、光电互联芯片和冷却材料的需求呈现三位数暴增。
- 中文投资视角解读:供应链产能瓶颈意味着具有自主先进制造能力或卡位关键材料学(如硅光子、新型铜介质极限互联)的硬件厂商将享有长期的超额定价权和极高估值护城河。
- Standard Intelligence 训练出基于 1100 万小时视频数据集的 30 FPS 通用计算机操作模型 [26]:旨在通过连续视频流预测来绕过当前智能体高度依赖“逐张截屏(screenshot-by-screenshot)”所带来的高延迟和高 Token 消耗 tax。
- 中文投资视角解读:该技术路径若成功商业化,将从根本上抹去智能体在数字交互中的延迟瓶颈,大幅拉升智能体在实时高频交易、瞬时客服等敏感场景中的商业渗透率。
- 具身智能面临人类大脑超低耗能标杆(30瓦)的物理能效挑战 [27]:人脑仅消耗 30 瓦功耗即可完成极高难度的物理世界 3D 导航与交互,而当前 AI 大模型与物理机器人的系统整合功耗要高出数个数量级。
- 中文投资视角解读:这表明“计算能效比(Performance-to-Power)”将成为衡量下一代边缘计算芯片、轻量化机器人控制算法是否具备商用物理可行性的绝对核心指标。
人事与人才市场(招聘、离职、薪酬)
- Scenix 核心技术研发人才随收购整体并入 World Labs 且发生地理迁移 [28, 29]:包括 Columbia 大学教授 Yunzhu Li [8]、曾在 Weta 和腾讯拥有资深 VFX/模拟引擎研发背景的 Changi Jan [28]、以及 Amazon 图像技术前 leader Sunny 等。Yunzhu Li 等核心人才正从东海岸迁往旧金山总部,World Labs 亦正式转型为双海岸办公室(SF 设立总部,NY 设立机器人远程测试点)。
- 中文投资视角解读:顶尖学术与工业复合型 3D/仿真人才向旧金山湾区的高度集聚,表明旧金山仍是具身智能物理 AI 研发的绝对引力中心;跨海岸多点协作对远程控制和机器人测试工程栈成熟度提出了更高要求。
- 半导体与数据中心老牌工业巨头高管向顶级 VC 流动 [30]:Guido Appenzeller(曾担任 Intel 数据中心事业部 DPG 的 CTO)正式加入 a16z,与深耕数十年系统软件的 Raghu Raghuram 等共同掌舵 Machine Age Fund 投资。
- 中文投资视角解读:老牌硬件供应链(如 Intel)核心技术高管的跨界,表明风险投资机构正在系统性升级其对复杂热物理、半导体和高压输电项目的专业筛选与科学评估门槛。
- 企业软件与系统集成商因部署 AI 智能体而发生大规模“人力再分配(Headcount Re-allocation)” [31]:CPG 数据平台通过部署智能体处理自愈爬虫,将专门维护 Scraper 的工程团队直接砍掉了一半(50%);某全球系统集成商部署 27 个智能体每日处理 1,500-2,100 个 IT 票据,目标是直接 redeploy(重新配置)低毛利托管服务中 20-25% 的员工数量。
- 中文投资视角解读:这给出了极其精确的企业降本增效量化指标。这证明智能体已开始实质性削减传统软件维护和外包集成商的人力成本开支,资金将从这部分省下的人力开销中流向智能体软件授权费。
- 2026 年最新劳动力薪酬及折算成本基准公布 [23]:根据 2026 年 BLS 官方数据,美国客服代表中位数时薪为 \$20.59,加上 30% 福利 overhead 后 fully-loaded 成本为 \$30-45/小时;根据 2026 年 Globalify、HiveDesk 和 1840 & Co 最新外包指南,印度等海外离岸 BPO 平均时薪为 \$10/小时(\$8-15 范围)。
- 中文投资视角解读:这组最新、最权威的宏观薪资与外包成本数据,为投资评估任何旨在替代劳动力(Labor-substituting)的 AI 智能体公司提供了最坚实的商业 ROI 测算分母。
下周关注点
待观察的公司 / 资产
- Standard Intelligence(1-4 周窗口)
- 关注内容:由于其基于 1100 万小时视频训练、运行在 30 FPS 的通用计算机操作模型已初露头角,未来一个月内需密切关注该模型是否会进行大范围 API 开放、开源或发布最新的低延迟真实测试数据,以验证其是否能彻底解决当前智能体“截图式”交互带来的高延迟和高 Token 税 [1]。
- World Labs / Scenix(1-4 周窗口)
- 关注内容:由于 Scenix 团队核心成员(如 Yunzhu Li 等)正整体向旧金山湾区搬迁,且 World Labs 正在两岸(旧金山总部与纽约远程点)配置实体测试机器人 [2]。未来 4 周内需跟踪其工程团队在两地远程控制与物理硬件测试栈的实际合拢情况,以及 Marble 大世界模型与 Scenix 仿真拟真管线的首个技术整合动态 [2, 3]。
- Clay(1-4 周窗口)
- 关注内容:关注该获客数据平台在 2026 年最新“新定价模式”(将 Data Credits、Actions 额度完全分离,并对高波动推理模型实行 Token 零加价透传)发布后的客户反馈 [4]。需跟踪未来 4 周内该模式是否能有效稳固其 Pro 级毛利率,并观察同赛道竞品是否会迅速抄袭该混合计费模板 [4]。
- a16z Machine Age Fund(1-4 周窗口)
- 关注内容:由于 a16z 刚于 2026 年 8 月 28 日宣布为其最新的“机器时代基金”成功募集 11 亿美元资金 [5, 6]。未来 1-4 周是其首批资金流向的黄金观察期,需高度关注其在芯片、高频宽内存、光网络互联、高密度散热、表后自备电力及机器人硬件等领域的首轮新项目投资公示 [6, 7]。
待验证的预测 / 催化
- llm-stats.com OSWorld-Verified 桌面基准排行榜刷新
- 验证内容:目前 Claude Fable 5 以 85% 的得分在真实桌面操作测试中领跑(超越人类平均的 72%) [8]。验证在未来几周内,OpenAI 的 CUA 架构更新、或者具备原生计算机使用能力的新版 Gemini 模型是否会上线该排行榜并击败 Claude,重夺智能体执行层的技术高地 [8, 9]。
- B2B 软件定价的“去 Token 化”行业风潮
- 验证内容:在 a16z 强力推行《You are not a model. Don't price per token.》(8月27日发布)的思想催化下 [10],观察在未来 1-4 周内,是否会有其他主流 AI 生产力应用、AI 编程助手或营销 Copilots 密集宣布修改服务条款,将计费从不透明的 Token/席位包装转向按 Effort-band(努力带宽)Credits 或 recognizable work 进行收费 [11-13]。
- 2026 年科技界巨型 M&A(并购)潮的开启
- 验证内容:David Haber 预测 2026 年将成为历史上规模最大的并购年 [14]。观察在未来一个月内,是否会密集出现传统软件巨头(如 SAP, ServiceNow)以折价或合理估值加速并购那些陷入 Token 物理成本挤压、无法独立实现毛利转正的 AI 智能体/应用初创公司的标志性交易 [14-16]。
未解决的悬念
- World Labs 机器人 omnimodel 基础模型的动作(Actions)模态如何落地?
- 悬念内容:Fei-Fei Li 确认 World Labs 正在构建一个融合 Action 输入与输出的多模态 omnimodel,用作机器人建模与 fine-tuning 策略的骨干网 [17, 18]。然而该模型的架构细节、支持何种特定的机器人硬件接口、以及如何控制 Action 输出的物理安全性,在本次谈话中依然悬而未决。
- 谁来定义多智能体(Multi-Agent)计算机使用的标准化编排框架?
- 悬念内容:目前绝大多数生产部署仍是 single-agent 系统,面对长程复杂任务,多智能体 bespoke 编排导致严重的延迟与 compound 失败率 [19]。行业正处于“缺乏类似 Claude Code 时代的标准化抽象编排框架”的空白期,未来哪家初创公司或开源框架能率先确立这个标准,依然是最大的悬念 [19]。
- Sim-to-Real 的物理拟真精确度极限在哪里?
- 悬念内容:虽然 3D 虚拟仿真被公认为解决机器人数据荒的救星,但 Yunzhu Li 和 Fei-Fei Li 均坦言,目前科学界和工业界仍在“深入调查(investigate)”到底需要达到何种级别的 Fidelity(精确度、质量、随机化参数范围),才能保证在 Sim 世界训练出的策略无缝 transfer 回多变的物理现实场景 [20, 21]。
- AI 智能体厂商在真实野外(Wild)环境下的终极商业模式是什么?
- 悬念内容:由于在野外真实场景中,智能体极易遇到偏离 Runbook 的长尾报错,其重复重试(Retries)会源源不断地烧毁 Token 并挤压利润,导致 vendors 难以准确预测 COGS [22]。厂商到底是该按 task、按小时(Agent-hour)还是按最终 Outcome 计费?目前行业仍处于“没有 one-size-fits-all 商业模式”的探索悬念中 [22]。