KNOWLEDGE STREAM

文章情报库

将公开技术文章转化为中文摘要、主题线索与可追溯的人工研判。

WEEKLY ACTIVITY

每周阅读趋势

最近六周的人工判断节奏

本周收藏 0 · 已整理 0

按关键词浏览

显示 14 篇
智能体世界模型机器人大模型模型评估

预训练以想象,微调以行动:世界-行动模型的崛起(Pretrained to Imagine, Fine-Tuned to Act: The Rise of World-Action Models)

本文探讨了机器人基础模型领域的新范式——世界-行动模型(WAM)。与基于视觉-语言模型(VLM)的VLA模型不同,WAM利用预训练的视频或世界模型骨干网络,将语言指令映射为视觉变化,再生成动作。文章分析了WAM的三种核心范式(逆动力学、联合预测、仅表示)、动作集成方式及架构,并通过Veo 3.1实验和DreamZero等案例展示了其潜力。作者认为,WAM将成为与VLA并行的第二条主要技术路线,未来更可能走向混合模型。

作者:Moritz Reuss

原文 ↗
发布于 2026-06-15 收录于 2026-07-12
机器人智能体产业动态人工智能

机器人初创公司 FieldAI 实现 1 亿美元营收与合同里程碑(Robot Startup FieldAI Achieves $100M Milestone in Revenue, Contracts)

机器人软件初创公司 FieldAI 宣布营收与客户合同总额突破 1 亿美元,客户覆盖欧美亚 30 多家企业。该公司成立于 2023 年,开发通用机器人“大脑”,已获 4.05 亿美元融资,估值 20 亿美元。其优势在于利用物理和概率构建“风险感知”AI,无需海量训练数据即可快速部署机器人,已在建筑、数据中心等领域实际应用。

作者:Rya Jetha

原文 ↗
发布于 2026-06-26 整理于 2026-07-12
智能体模型评估机器人大模型具身智能

RoboGaze:通过结构化视觉-语言分析评估机器人世界模型(RoboGaze: Evaluating Robot World Models via Structured Vision-Language Analysis)

RoboGaze 是一个无需训练的多智能体 VLM 框架,用于结构化、可解释的机器人操作视频评估。它通过任务-场景接地、维度特定专家路由和基于批评者的验证三阶段流程,输出基于新提出的6维度30类型机器人特定故障分类法的、时间定位的故障报告。在包含382个剪辑的基准测试中,RoboGaze 在描述 F1 上比零样本基线提升高达43分,时间对齐提升37分,并将干净剪辑准确率从低于25%提升至超过80%,缩小了约85%的与人类评估的差距。

作者:Minh-Loi Nguyen, Nghiem Tuong Diep, Hung Khang Nguyen, Minh Le, Doanh Le Thien, Hoang H. Tran, Dung D. Le, Vu N. Duong, Daniel Sonntag, An Thai Le, Duy Minh Ho Nguyen, Vien Anh Ngo, Tran Van Nhiem

原文 ↗
发布于 2026-06-22 整理于 2026-07-12
世界模型人工智能智能体产业动态模型评估

风投向AI的下一个大赌注投入30亿美元:世界模型(VCs Pour $3 Billion Into AI's Next Big Bet: World Models)

2026年上半年,风投向“世界模型”初创公司投入超30亿美元。这类AI系统旨在模拟现实而非处理文本,被视为语言模型商品化后的下一个可防御前沿。关键投资包括Yann LeCun的AMI获10.3亿美元种子轮,李飞飞的World Labs获10亿美元。该领域缺乏统一定义,系统被分为渲染器、模拟器和规划器三类。主要挑战包括实现长期一致性、开发稳健表征以及获取交互数据护城河。英伟达和亚马逊是主要支持者。怀疑论者指出估值过高,真正的考验在于机器人领域的“模拟到现实的相关性”。

作者:Josipa Majic Predin

原文 ↗
发布于 2026-06-30 整理于 2026-07-12
世界模型人工智能智能体产业动态融资

世界模型制造商 Odyssey 获亚马逊等巨头投资,估值达 14.5 亿美元(World model maker Odyssey nabs $1.45B valuation backed by Amazon and other big names)

由自动驾驶先驱创立的世界模型AI初创公司Odyssey完成3.1亿美元B轮融资,估值达14.5亿美元,由Natural Capital领投,亚马逊、AMD Ventures、GV等参投。Odyssey通过人员背负摄像头采集物理世界数据,模拟类似谷歌地球的精确物理世界模型,应用于视频游戏和机器人等领域,并选择AWS作为首选云提供商,优化其模型以在Trainium芯片上运行。

作者:Julie Bort

原文 ↗
发布于 2026-06-17 整理于 2026-07-12
世界模型人工智能机器人具身智能产业动态

世界杯已至,世界模型会是下一个吗?(The World Cup Is Now, Are World Models Next?)

世界模型正成为AI资本最密集的前沿领域,Dyna Robotics、FieldAI、Odyssey和World Labs等厂商已累计融资约20亿美元。与LLM不同,世界模型学习环境随时间变化,适用于机器人、自动驾驶和工业运营。技术仍处早期,但已在合成环境生成、非结构化工业自主操作和通用具身智能三个层面积累动力。企业需区分商业现实与市场炒作,在工厂等边界明确环境,数字孪生加物理模拟器通常已足够;世界模型在建筑工地、矿山等动态变化环境中最具价值。

作者:['Aleksander Milligan']

原文 ↗
发布于 2026-06-23 整理于 2026-07-12
智能体世界模型融资人工智能具身智能

General Intuition 洽谈以约20亿美元估值融资3亿美元(General Intuition in talks to raise $300M at around $2B valuation)

总部位于纽约的初创公司 General Intuition 正在洽谈以约20亿美元估值融资3亿美元。该公司构建基础模型,训练 AI 智能体在时空中的移动能力。此轮融资距其从 Medal 分拆并获得1.34亿美元种子轮仅八个月。投资者包括杰夫·贝索斯、埃里克·施密特、Khosla Ventures 和 General Catalyst。General Intuition 利用 Medal 每年20亿个视频的数据集训练具身 AI 和世界模型,其独特之处在于构建世界模型来训练智能体,而非直接销售模型。资金将用于扩大计算能力,计划夏末或初秋发布新产品。

作者:Rebecca Bellan

原文 ↗
发布于 2026-06-18 整理于 2026-07-12
智能体世界模型训练数据产业动态

General Intuition 的 23 亿美元赌注:用电子游戏训练现实世界的 AI 智能体

AI 初创公司 General Intuition 获得 3.2 亿美元融资,估值 23 亿美元。该公司利用其兄弟公司 Medal 的数亿小时游戏录像及按键动作标签数据,训练具备时空推理能力的通用智能体模型。该模型可同时驱动游戏角色和实体四足机器人,并仅需少量真实世界数据即可微调。公司计划将模型 API 商业化,并承诺不用于致命自主武器系统。

作者:Rebecca Bellan

原文 ↗
发布于 2026-06-25 整理于 2026-07-12
智能体模型评估产品学术研究

理解是新的瓶颈(Understanding is the new bottleneck)

随着AI智能体编写越来越多代码,人类理解代码的能力成为新瓶颈。作者认为理解不是为了验证,而是为了参与创造过程。他提出三种高效理解代码的技术:代码解释文档(含背景知识、直觉引导、交互式图表和测验)、微型世界(通过交互式调试器和游戏化迁移工具直观理解系统)、共享空间(团队在协作平台中共同建立心智模型)。核心主张是AI应增强人类理解而非完全自动化。

作者:Geoffrey Litt

原文 ↗
发布于 2026-07-02 整理于 2026-07-11
智能体模型评估产品推理

Know your unknowns — 示例

本文介绍了11个自包含的HTML文件,用于在实施前、实施中和实施后发现未知问题。这些文件展示了如何通过盲点扫描、交互式解释器、设计方向探索、原型模拟、头脑风暴、访谈、参考移植、可调整计划、实施笔记、提案文档和合并前测验等方法,低成本地发现并应对项目中的未知因素。

原文 ↗
发布时间未知 整理于 2026-07-11
模型评估记忆系统智能体产品

演进中的记忆系统:一种评估优先的方法(Evolving Memory Systems: An Eval-First Approach)

人们正在为 AI 助手和个人代理构建各种花哨的记忆系统。我的 X 时间线上充斥着诸如向量存储、知识图谱、语义记忆、情景记忆、用户画像、对话摘要、分层检索、记忆整合、记忆衰减等术语…… 毫无疑问,其中许多想法是有用的。有些可能不可或缺。但该领域存在一种奇怪的失衡:我们花费大量精力发明记忆架构,却很少投入精力改进用于评估这些系统是否真正让代理随时间更好地使用记忆的评估方法。 结果是大量的过度工程化。人们基于自己对“良好记忆”应为何样的狭隘定义来构建记忆系统。没有严肃的评估环境,这些大多只是架构上的赌注。

作者:Linghao Zhang

原文 ↗
发布于 2026-06-27 整理于 2026-07-11
大模型

循环详解:Claude、GPT、Mira 以及真正有效的方法(Loops explained: Claude, GPT, Mira and what actually works)

Anatoli Kopadze 在 X 上:"https://t.co/eq0oL4fIaR" / X 人工智能已经掌握在每个人手中多年。大多数每天使用它的人仍然在使用最慢的方式:输入请求,等待,修正,再次提问,全部手动操作。 不是因为更快的方式…… 新用户? 立即注册,获取专属个性化时间线! 使用 Google 注册 使用 Apple 注册 创建账号 注册即表示您同意服务条款、隐私政策及 Cookie 使用。 相关人物 Anatoli Kopadze @AnatoliKopadze 关注

作者:Anatoli Kopadze

原文 ↗
发布于 2026-06-20 整理于 2026-07-11
智能体大模型推理模型评估

Fable的判断力

赞助商:Teleport — 如何确保AI代理在你的预期边界内行动?Teleport的《从零信任到代理信任》白皮书详细说明了实现代理设计承诺所需的条件。 周三我在AIE上与Claude Code团队的Cat Wu和Thariq Shihipar主持炉边谈话时,得到的最有趣建议之一是:让Fable(在某种程度上也包括Opus)运用自己的判断力,而不是规定它们应该如何工作。 他们举的例子是测试。你可以告诉Fable"只对较大的功能使用自动化测试,不要为小的文案或设计修改更新和运行测试"——但更好的做法是直接告诉Fable在决定是否编写测试时运用自己的判断力。

作者:Simon Willison

原文 ↗
发布于 2026-07-03 整理于 2026-07-11