meta-balena:实践指南
2026-09-12
2026-09-14 0
面对实际交付,我看Awesome-Embodied-AI的重点不在星标,而在这项能力:具身智能研究资源清单,按场景理解、图像、点云等主题整理相关论文与项目,便于跟踪该领域的方法和数据资源。团队若要把它用于研究与论文处理,应先处理来源证据、引用和结论容易脱节,否则试用结果很容易失真。我的评估方法是拿一篇熟悉的论文或研究问题跑完整流程,然后检查证据定位、引用准确性和结论可复核性是否与文档一致。它更像给需要整理研究证据并愿意复核原文的读者准备的可审查方案,是否长期使用应由试跑数据决定。
真棒-体现-AI
场景理解
图片
| 描述 | 纸 | 代码 | |
|---|---|---|---|
| SAM | 细分 | ||
| YOLO-世界 | 开放词汇检测 |
点云
| 描述 | 纸 | 代码 | |
|---|---|---|---|
| SAM3D | 细分 | ||
| PointMixer | 理解 |
多模式接地
| 描述 | 纸 | 代码 | |
|---|---|---|---|
| GPT4V | MLM(Image+Language->语言) | https://arxiv.org/abs/2303.08774 | |
| 克劳德3号作品 | MLM(Image+Language->语言) | https://www.anthropic.com/news/claude-3-family | |
| GLaMM | 像素接地 | ||
| 全视 | 像素接地 | ||
| LEO | 3D |
数据收集
来自视频
| 描述 | 纸 | 代码 | |
|---|---|---|---|
| 视频机器人 | |||
| RT-轨迹 | |||
| MimicPlay |
硬件
| 描述 | 纸 | 代码 | |
|---|---|---|---|
| UMI | 两指 | ||
| DexCap | 五指 | ||
| HIRO 手 | 交手 |
生成模拟
| 描述 | 纸 | 代码 | |
|---|---|---|---|
| MimicGen | |||
| RoboGen |
动作输出
生成模仿学习
| 描述 | 纸 | 代码 | |
|---|---|---|---|
| 扩散正策 | |||
| ACT |
可供性地图
| 描述 | 纸 | 代码 | |
|---|---|---|---|
| CLIPort | 取放 | ||
| 机器人可供性 | 接触及接触后轨迹 | ||
| 机器人-ABC | https://github.com/TEA-Lab/Robo-ABC | ||
| 探索何处 | 从语义相似性中学习的镜头很少 | ||
| 说走就走,互动随心所欲 | 扩散模型对运动的可供性 | ||
| AffordanceLLM | LLM 的接地功能 | ||
| 环境意识可供性 | |||
| OpenAD | 来自点云的 Open-Voc 可供性检测 | ||
| RLAfford | 使用 RL 进行端到端的可供性学习 | ||
| 一般流程 | 从视频中收集可供性 | ||
| PreAffordance | 预抓规划 | ||
| ScenFun3d | 3D 场景中的细粒度功能和可供性 |
LLM 的问答
| 描述 | 纸 | 代码 | |
|---|---|---|---|
| COPA | |||
| ManipLLM | |||
| ManipVQA | https://github.com/SiyuanHuang95/ManipVQA |
语言修正
| 描述 | 纸 | 代码 | |
|---|---|---|---|
| OLAF | |||
| YAYRobot | https://github.com/yay-robot/yay_robot |
规划自LLM
| 描述 | 纸 | 代码 | |
|---|---|---|---|
| SayCan | API 等级 | ||
| VILA | 提示级别 |