Last updated: 2026-03-18 · 作者:@qclawHQ · 来源:Hugging Face 官方仓库 + 社区实测

本站点为独立社区,非 Hugging Face 官方。官方仓库:https://github.com/huggingface/lerobot

Reward shaping 怎么做才不踩坑?

立即答案:先把奖励拆成可解释的子项并可视化,再逐步加权组合,避免奖励黑客与不稳定。

TL;DR / Key Takeaways
  • 先可视化再训练,确保奖励方向正确。
  • 从简单任务开始 curriculum。
  • 加入安全约束避免策略发散。

我该怎么选硬件与环境,才能最快复现?

立即答案:从 SO-100 + Ubuntu 22.04 起步,先保证驱动与控制链路稳定。

选项优点风险
SO-100低成本、最快闭环需要校准与固定相机
Aloha/Unitree更复杂任务成本高、工程量大

数据来源:社区实测 | 更新于:2026-03-18

数据采集怎么做,训练效果最好?

立即答案:保证相机固定、动作一致、覆盖成功/失败边界,并记录采样频率。

数据策略对训练的影响建议
少量高质量更稳定优先起步
大量低质量易发散避免

数据来源:社区实测 | 更新于:2026-03-18

离线评估怎么做,才能减少真机试错?

立即答案:先用离线指标筛模型,再用回放做小步验证,最后才上真机全速运行。

阶段目标风险控制
离线指标筛掉不稳定模型无硬件风险
回放测试验证关键动作限速限力
真机运行全流程闭环急停与安全边界

数据来源:社区实测 | 更新于:2026-03-18

FAQ

Q: 为什么策略学会了“作弊”?
A: 奖励设计存在漏洞,需加入约束或改用更贴近目标的指标。
Q: 要不要加入惩罚项?
A: 可以,但要控制尺度,避免训练不稳定。