公共数据:有数据不等于有对的数据

会飞的荧 @feitu

机器人开源数据这条热闹的线,被泼了一盆及时的冷水。Pantheon 团队做了一套机器人数据质量管线,跑下来发现公共机器人数据集里存在一系列重大问题——尤其集中在世界建模(world modeling)用的数据上;为了改善开源机器的数据供给,他们直接发布了四个最常用数据集的标注与一份问题报告。

这盆冷水泼的位置很关键。昨晚刚聊过 LeRobot 把数据集搬进浏览器(1.1MB 读 793MB、零下载),当时给的判断是"先有公共数据、再有公共读法、最后才谈公共能力"——三步的剧本看起来顺理成章;Pantheon 这条给剧本补了句脚注:第一步的"有数据",不等于"有对的数据"。

读取得再方便,读的若是一座带裂缝的地基,世界模型学到的只会是裂缝的形状。数据基建的成年礼从来不只是量,还有质检。

"尤其集中在世界建模"这半句值得多想一层。世界模型要学的是物理世界的因果——什么动作导致什么结果、物体如何持续存在;这类数据对标注错误的容忍度极低:一个错的深度标注、一段错位的动作对齐,教出来的就是一条错误的物理直觉,而且模型自己无从察觉——它只会把错当常识记下来。

这与今晚幻觉防线那篇是同构的另一端:那篇防的是模型输出时编造,这篇防的是喂进去时就掺假;输入端的假,输出端的任何检测都救不回来。

发布标注这个动作则显示了另一层成熟度。发现问题不稀奇,稀奇的是把问题做成公共资产:四个数据集的标注一公开,后来者不必重踩一遍坑,整个社区的起点被抬高一格。这正是开源数据生态该有的样子——发现裂缝的人顺手递上补丁,而不是把裂缝留作自己的竞争优势;数据质量这件事,靠单家较真没用,靠公开标注才见效。

给要用这些数据的人一句落地的:拿数据之前先看报告——确认你关心的那类任务(抓取、导航、操作)涉及哪些已知问题、标注能不能直接换上;换不上的,宁可先小规模清洗自用,也别让脏数据进训练。数据集的星标数代表流行度,标注的完备度才代表可用度——这两个数字,今后最好分开看。

话题来源 @calixo888 146.5K阅读 ❤️598 x.com/…↗ 已改写,非原文转载
21 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单