标签

manipulation

LeHome Challenge @ ICRA 2026 个人参赛复盘
本文记录了我以个人身份参加 ICRA 2026 LeHome Challenge 的完整过程。从环境搭建、数据准备,到 ACT / Diffusion Policy / SmolVLA / pi0.5 四条技术路线的尝试与取舍,再到最终方案的选择与提交。重点不是晒成绩,而是记录真实参赛者在有限时间和资源下的路线决策过程与工程踩坑经历。
2026-05-10
|
218
|
0
|
0
LeHome Challenge @ ICRA 2026 个人参赛复盘
LeHome 尝试 pi0.5:依赖地狱、LoRA 微调与截止前的放弃
我试图用 pi0.5 冲一波分。结果一头扎进了依赖地狱:LeRobot pi0.5 需要特定版本的 transformers(4.53.2,不是 4.57.6)、需要 OpenPI 的 `transformers_replace` 补丁、需要 Hugging Face token 授权 paligemma 模型。本文记录完整的排障过程、LoRA 微调训练(sanity check → 30k → 150k → 270k)、以及最终"初具人形但依旧悬空"的评测效果。在截止前未能得到可用结果,pi0.5 最终未作为主力方案。
2026-04-26
|
305
|
0
|
0
LeHome 尝试 pi0.5:依赖地狱、LoRA 微调与截止前的放弃
LeHome SmolVLA 微调:从 Smoke Test 到 Baseline 提交
在 ACT 和 DP 之后,我开始尝试 SmolVLA。选择 SmolVLA 的理由很简单——它是一个相对轻量的 VLA 模型,官方提供了预训练权重和训练配置,在有限算力下跑起来比较现实。本文记录从首次 smoke test、发现并修复 camera key 不兼容问题(自定义 Policy)、到 30k 四类 baseline 训练的完整过程。最终四类评测结果:top_short 8.33%、top_long 50.00%、pant_long 16.67%、pant_short 75.00%。
2026-04-24
|
143
|
0
|
0
LeHome SmolVLA 微调:从 Smoke Test 到 Baseline 提交
LeHome 跑 Diffusion Policy:不太理想的尝试
在 LeHome Challenge 中,我在跑通 ACT baseline 之后尝试了 Diffusion Policy。结果不太理想——`top_short` 任务上 30k 成功率为 0%,50k 仅 16.67%。本文记录完整的尝试过程:从 DP smoke test 到长训、从发现左手抓取偏置到逐步 debug(policy 输出日志、环境执行日志、expert replay 对照、单件测试),以及最终判断——问题更可能是 DP rollout 不稳定而非数据或配置错误。同时也发现当时的实验环境代码基线落后官方 main,可能影响了 DP 的结果。
2026-04-14
|
67
|
0
|
0
LeHome 跑 Diffusion Policy:不太理想的尝试