具身智能从原理到真机实战
Leo
某大厂 AI 大模型应用负责人
59 人已学习
新⼈⾸单¥59
具身智能从原理到真机实战
15
15
1.0x
00:00/10:34
登录|注册

开篇词|打通原理、数据、框架、真机四条线,让具身智能从论文回到桌面臂

讲述:张浩AI版大小:12.08M时长:10:34
你好,我是 Leo,欢迎你加入课程。
这是一门具身智能方向的入门实战课,我会用自己的亲身实践经历带你高效启程。很多做过大模型应用开发的同学会好奇:软件 Agent 和具身 Agent 真正开发起来到底有何差别,举个例子你会有更直观的感受。
在做具身智能开发时,有种情况很普遍。训练脚本正常结束,loss 也在下降。我们把 checkpoint 接到机械臂上,以为接下来只差录一段成功视频,从臂(Follower)却突然向错误方向摆动。
终端没有异常,模型也没有报错。真正的问题可能藏在另一个地方:训练和推理的处理规则不一致;相机输入接错;主臂和从臂的标定没有对齐;又或者模型输出的动作含义,与执行端的理解不同。
做软件 Agent 时,接口错了往往还能重试,数据库写坏了还能回滚。到了机械臂上,一组“格式正确、含义错误”的数字,会直接变成电机动作。物理世界不会替我们抛出一个更友好的异常。
我开这门课程,就是想把这段最容易被略过的距离讲透:从“模型能训练”走到“机器人能稳定完成任务”,中间究竟要补哪些知识、留下哪些证据,又该怎样排查失败。

我如何从 Agent 走到机械臂

我做了十几年软件开发,近几年主要在大模型应用和 Agent 方向工作。我搭过企业级智能体平台,用 LangGraph 编排过多个业务场景,也完整经历过数据标注、模型微调和上线部署。
做这类系统久了,我习惯先看分层:上层负责理解目标和规划任务,下层调用工具执行,中间靠清楚的接口和评测把它们接起来。最初接触具身智能时,我自然地把机械臂理解为一种新的执行器——规划器决定“做什么”,策略模型负责“怎么动”。
这个类比是有用的,却不完整。
我自己买了机械臂,想用最短路径跑通一次桌面抓取。第一周遇到的不是高深的算法问题,而是电机过载、标定范围不对、主从臂方向不一致。好不容易录完十几条遥操作数据,回放后才发现多数轨迹不能用:动作犹豫、路径不一致、关键接触阶段被遮挡。
我只好停下来,退回仿真,把行为克隆、强化学习和动作分块重新跑一遍;再回到真机,把采集、回放、训练和评测拆成一道道门禁。数据宁可少一点,也不拿坏轨迹凑数;动作上线之前先核对坐标、统计量和时间窗口;结果不再靠一条高光视频,而是按固定条件逐次记录。
第二次回到桌面臂,问题才开始变得可解释:哪里是数据覆盖不足,哪里是模型真的不会,哪里只是工程合同没有对齐。机械臂连续完成任务当然让人兴奋,更有用的收获是,我终于知道下一次失败该先看哪一层。
所以,我们的课程不会围着一段成功演示反复解说。我会把“怎样得到可信结果”拆到每一步:数据怎样录,动作怎样对齐,模型怎样验收,失败又怎样回到下一轮实验。

软件 Agent 工程师并不是从零开始

结合我的经历,我切身体会到“软件开发”转型“具身智能”领域是有高效路径的。
如果你做过 LLM 应用、后端平台或机器学习工程,很多经验都可以迁移:
Tool schema 对应机器人的 observation / action 合同;字段维度相同,不代表语义相同。
Trace 对应 episode 日志;没有时间轴,就很难解释一次动作为什么失败。
Eval 对应固定协议下的闭环 rollout;只看训练 loss,就像只看工具调用格式、而不看任务是否完成。
Guardrail 对应限幅、急停、接管和回家路径;安全层不能等模型“自己学会”。
线上坏例库对应失败轨迹库;有标签的失败,才可能变成下一轮补采计划。
接下来要补的,是物理系统特有的四种直觉:
闭环直觉模型的一次小误差会改变下一时刻看到的画面,后面的输入不再来自训练分布。离线预测得准,不等于放进闭环还能完成任务。
数据直觉机器人数据不是“视频加一份电机日志”,而是每个控制周期中严格对齐的图像、关节状态、动作和任务文本。采集节奏、相机位置、时间戳和坏轨迹处理,往往比多调一组超参更影响结果。
动作直觉绝对位置、相对位移、归一化动作看起来都像数组,却代表不同的执行语义。动作块、时序融合和控制频率,也不是模型结构旁边的可选装饰,而是轨迹能否连续的关键。
证据直觉真实机械臂会把数据、模型、硬件和环境问题混在同一次失败里。必须保留数据版本、checkpoint、逐次试验、失败标签和视频,才能把“感觉不太行”还原成可验证的判断。
掌握这四种直觉,你学到的就不只是 SO-101 的一套命令,而是一种可以迁移到其他机械臂、策略和任务上的工程方法。

这 23 讲怎样把闭环跑起来

课程由五个模块组成,始终围绕同一条主线推进。
原理底座篇先回答“为什么”。你会用 MDP 看懂感知、决策和执行,分清模仿学习、强化学习与 VLA 的边界,再沿着协变量偏移理解单帧 BC 为什么一进闭环就容易崩,以及 ACT、Diffusion、Flow Matching 三类动作头分别在解决什么问题。
数据平台篇处理最容易被低估的一层。我们从一帧数据出发,读懂 LeRobot Dataset v3 的 Parquet、MP4、metadata 和 stats,随后把采集纪律、质检、加工、打标、轨迹还原与失败补采接成数据飞轮。你不只会“录数据”,还会判断一批数据为什么值得训练。
LeRobot 框架实践篇进入模型。先沿数据流和 processor 合同排查真机乱动,再建立 ACT 基线:用 one-batch overfit 暴露数据与训练实现中的问题,完成训练,比较 Temporal Ensembling,并用逐次闭环试验和 95% 置信区间报告结果。10 次试验只是起步,区间往往仍很宽,不能据此保证部署可靠。随后再做 Diffusion 的公平对照和 SmolVLA 的参数高效微调,判断什么时候该换模型,什么时候应先修数据和执行链路。
真机机械臂篇把策略接到 SO-101。我们从电机、总线、标定和相机建立硬件心智模型,依次通过连通、安全、小步运动、遥操作、采集、回放、训练和评测。这里不会把真机当作最后一讲的彩蛋,安装、校准、遥操作和失败诊断本身就是主线。
工程交付篇把前面的能力组装起来。大模型提出计划,技能层限定任务范围,ACT 或 VLA 生成连续动作,再逐项接入限幅、停止、接管和运行记录。配套仓库提供接口示例与离线检查,不是一套接上电机就已验证安全的完整系统。作品集要说明哪些部分已接入、怎样验证,以及哪些仍是设计。
课程路线:先安全上机,再采集与检查,最后训练与验证
00:00 / 00:00
    1.0x
    • 3.0x
    • 2.5x
    • 2.0x
    • 1.5x
    • 1.25x
    • 1.0x
    • 0.75x
    • 0.5x
    网页全屏
    全屏
    00:00
    课程真机视频
    先观察一遍完整动作,再想一想:如果它下一次失败,你最想回到哪一步查原因?带着这个问题进入后面的课程就够了。

    学完以后你能带走什么

    把课程练习接到自己的设备并完成验证后,可以按下面四类成果整理项目:
    一份符合 Dataset v3 约定、能回放和质检的机器人数据集;
    一组可复现的 ACT 基线与算法对照,包含配置、日志和完整 checkpoint;
    一份按固定协议执行的真机评测表,成功和失败都进入分母;
    一个具备规划、技能执行、安全接管和运行记录的具身 Agent 项目。
    课程里出现数字时,我会先说清楚它从哪里来。能找到完整原始记录的,才算实测结果;在简化环境里跑出的,会标成课程仿真;只为帮助理解计算方法的,就叫示例。比如 29 次成功、30 次尝试,算出来是 96.7%。但如果拿不出这 30 次试验记录,它就只能是一个计算例子,不能当成你的真机成绩。
    这套要求看起来严格,却正是作品集与普通 demo 的分界线。招聘者真正想看到的,不只是机械臂成功了一次,而是你能否解释系统、复现实验、定位失败,并说明下一轮为什么这样改。

    怎样起步与高效入门

    每学一讲,都建议问自己三个问题:
    “这一讲新增了哪一份合同?”它可能是数据 schema、动作语义、相机名称,也可能是成功判定。
    “我用什么证据证明它成立?”一条命令退出码为 0 通常不够,还要看回放、曲线、配置快照或逐次试验。
    “如果它不成立,最小的下一步实验是什么?”先把失败缩小到某一层,再只修改一个变量。数据、模型、标定和相机一起改,即使偶然成功,也很难知道是哪项修改起了作用。
    没有机器人开发背景并不妨碍开始。不过需要你会用 Python,理解监督学习的基本概念;不要求先会 ROS,也不要求一开始就有高端 GPU。没有真机时可以先完成原理、数据分析和训练门禁,有 SO-101 后再接上机械臂章节。重要的不是一次性把所有工具装齐,而是沿着闭环逐步补齐证据。
    从屏幕上的 Agent 到桌面上的机械臂,变化最大的不是模型规模,而是每一个判断都会变成真实动作。也正因为如此,这个领域特别欢迎那些愿意把接口、数据、评测和失败认真做实的工程师。
    具身智能职业发展指南:从已有能力出发,补上关键一层
    Agent 的下一站正在走进物理世界,而现在仍是把基础能力补齐、做出第一条可信闭环的窗口期。产业需要的不只是会读论文的人,更需要能把模型接到数据、设备和评测上的工程师。你不必等所有条件成熟才开始:先让论文里的方法回到桌面臂,做成一个能运行、能解释、也能复现的小项目,就是进入这个方向最扎实的一步。
    课程正式开始,期待与你一起投身具身智能浪潮,共同参与这一前沿领域的成长与突破!
    确认放弃笔记?
    放弃后所记笔记将不保留。
    新功能上线,你的历史笔记已初始化为私密笔记,是否一键批量公开?
    批量公开的笔记不会为你同步至部落
    公开
    同步至部落
    取消
    完成
    0/2000
    荧光笔
    直线
    曲线
    笔记
    复制
    AI
    • 深入了解
    • 翻译
      • 英语
      • 中文简体
      • 法语
      • 德语
      • 日语
      • 韩语
      • 俄语
      • 西班牙语
    • 解释
    • 总结
    仅可试看部分内容,如需阅读全部内容,请付费购买文章所属专栏
    《具身智能从原理到真机实战》
    新⼈⾸单¥59
    立即购买
    登录 后留言

    全部留言(1)

    • 最新
    • 精选
    • llmlearning
      太棒了👍
      2026-09-15归属地:北京
    收起评论
    大纲
    固定大纲
    我如何从 Agent 走到机械臂
    软件 Agent 工程师并不是从零开始
    这 23 讲怎样把闭环跑起来
    学完以后你能带走什么
    怎样起步与高效入门
    显示
    设置
    留言
    1
    收藏
    1
    沉浸
    阅读
    分享
    手机端
    快捷键
    回顶部