从视频回放到问题定位
Cohort comparison
将同任务的 101 条轨迹按可追溯行为分组,并区分 demo 与 policy truth。
Timeline review
Goal、当前状态、目标距离和中文说明沿时间轴同步显示。
Synchronized evidence
三路相机、逐步 action、原生 score 与运行 manifest 对齐到同一个 step。
ZIWU AI 将具身智能运行中的任务目标、运行状态、目标距离和失败位置,与视频及原生结果放在一起,方便比较和复核。
Connector 接入运行,Graph 记录任务与运行关系,Visualization 展示差异;结果可用于选型、门禁、数据采集和复测。
图中将 Agent、机器人和世界模型运行统一为事件,并映射到语义任务图、任务地形和度量坐标;结果保留版本、视频、action 和原生输出来源。
Task / Robot / Policy / Episode
Metric / Failure / Evidence
Workflow / Landscape / Replay
Match / Gate / Route / Retest
Test Cell → Robot Town
评测结果用于后续部署、训练和复测。
将同任务的 101 条轨迹按可追溯行为分组,并区分 demo 与 policy truth。
Goal、当前状态、目标距离和中文说明沿时间轴同步显示。
三路相机、逐步 action、原生 score 与运行 manifest 对齐到同一个 step。
规划将成功率、执行成本和经验证的过程指标用于发布门禁;当前尚未形成完整闭环。
对终点相似的运行,比较耗时、路径、方向反转和低活动步。
基础设施 pass 仅表示环境可运行,与 policy success 分开记录。
任务要求把四个蛋放入蛋盒、关盖并让机器人回到原位。两个官方示教以真实速度同步起播:Episode 2 在 10.80 秒结束,Episode 54 还要继续 18.64 秒。
两次运行耗时分别为 10.80 秒和 29.44 秒。同步多视角回放用于核对额外动作发生在哪个阶段,并将耗时、动作路径、方向反转和低活动步记录为可复测指标。
绿色代表 Episode 2,橙色代表 Episode 54。全部数字来自官方示教视频与 14 维 action;没有 ground truth 的成功分不会填成 0 或 100。
每根柱子聚合一段 14 维 action 的相邻变化量。点击柱子可以跳回相应视频时间;Episode 54 的时间轴横跨 29.44 秒,因此相似终点背后的额外等待与反复修正仍可检查。
之前的 Fold Clothes 官方示教没有删除。它现在承担更合适的角色:展示肉眼更难稳定识别的 4%–10% 级质量差异。


Episode 36 的动作空间路径更短;同时快 4.2%,最终轮廓矩形度代理高 5.9%。这组差异幅度较小,可用于说明持续评测与回归检测的作用。
下载 Fold Clothes 报告单次演示不足以描述部署质量。Anchor 保留完整 run、失败样本和 cohort 分布。
新 policy 仍然成功,却变慢、绕路、抖动或依赖更多修正;success rate 无法单独反映这些过程变化。
同任务、同 seed、同 rubric 自动对比,让性能退化在合并前被检测,而不是上线后才暴露。
失败定位和高质量轨迹筛选反向指导数据采集、policy 训练与下一轮评测。
本节列出各类证据可以支持和不能支持的结论。
fill_pen_holder 页面保留了 1100-step trace、三路同步视频、GPU manifest、过程指标、双 runtime 结论和轨迹 MLOps 视图。