具身ICL来了创业玩家!上下文成Scaling新赛道
让机器人学会利用更长的多模态Context
衡宇 发自 凹非寺 量子位 | 公众号 QbitAI
2020年,GPT-3靠“看几个示例就会新任务”震动了NLP界;六年后的今天,同样的故事正在具身智能领域上演。
没错,就是 In-Context Learning 。
8月中旬, Skild AI发布机器人基础模型S1 。只需要给机器人看一遍任务演示视频,它可以在不微调、不做额外post-training的情况下,尝试完成此前没有训练过的新任务。任务时长可达10分钟,包含几十个操作步骤。
Skild在(训练数据)见过的任务和未见过的任务上,对比了ICL视频Prompt和传统的语言Prompt VLA。
测试结果表明,当训练数据只有1000小时时,语言Prompt效果更好,而随着数据规模增加,ICL开始反超。对于未见任务,加入视频context后,模型表现相比只用语言指令提升约7倍。
S1发布的一周之前, Generalist AI发布GEN-1.5,同样把One-Shot Learning作为核心能力。 机器人只看一个示范,就能在数秒内学习新任务,无需梯度更新或微调,并支持人类示范到机器人执行、组合泛化和Sim-to-Real迁移。
这两项进展都是在尝试让机器人学会利用更长的多模态Context。
In-Context Learning(ICL)这条路径, 已经在LLM领域被验证、并成为至关重要的一环。
2020年,OpenAI在GPT-3的论文Language Models are Few‑Shot Learners中提出ICL,定义它是一种能力——不给模型做任何参数更新(没有微调、反向传播训练),仅在输入prompt中提供若干任务示例(demonstrations/examples),模型在单次前向推理过程中就能够识别并执行该新任务。
过去三年,上下文从4K扩展到1M,让模型能一口气处理一整本书、一个代码库,背后的主要引擎就是ICL。
与LLM不同,具身模型面对的是视觉观测、语言指令与动作序列交织的复合上下文,且真实任务是非马尔可夫的——“接下来做什么”取决于“几分钟前做过什么”。
简单来说,具身模型面对的上下文是每秒几十帧视觉观测,外加本体状态与动作序列,信息量高出几个数量级。
直到今年7月16日,才有李飞飞、Jim Fan、Yuke Zhu等合著的机器人长上下文策略模型与训练方案 RoboTTT,第一次系统地把“上下文 scaling”这条路线搬到机器人视觉运动策略上。
8月,Generalist和Skild发布成果。
虽然两家公司仅以成果发布形式展示模型效果,技术细节没有完整公开,但在具身领域,关于ICL讨论度随即骤升。
这条路能否在具身领域真正跑通,取决于一系列远未解决的技术问题。
也正因为如此,我们产生了更具体的好奇:
如果具身智能真的要沿着Long Context和ICL继续往前走,机器人究竟要怎样理解如此复杂的上下文?
示范、语言、历史动作甚至人的纠正,又该怎样进入模型?
于是,我们找到了 可可矩阵 (COCO Matrix),一家致力于把In-Context Learning做成具身智能的底层范式的国内创业公司。
这家公司成立于2026年4月。
不过创始人兼CEO高宇翔告诉我,今年1月深入讨论创业相关事宜时,他和自己的co-founder就一致认为是时候着手押注ICL了。
高宇翔 今年30岁,西安交大少年班出身,约翰斯·霍普金斯大学(JHU)博士辍学,在读期间做人机交互研究。
高宇翔说,GPT-3展现出上下文学习能力时,还在JHU读博的他就已经在琢磨,这种“不给参数更新、只看示例就会新任务”的能力能不能搬到机器人身上?
此后五年,他辍学、回国创业、加入工业界、再次创业。
原文链接:https://www.qbitai.com/2026/09/484897.html
← 返回 AI 资讯列表