ZIWU AIEmbodied Intelligence Measurement
EMBODIED AI · EVALUATION & DIAGNOSIS

具身智能运行
评测与诊断

ZIWU AI 将具身智能运行中的任务目标、运行状态、目标距离和失败位置,与视频及原生结果放在一起,方便比较和复核。

TASK-GRAPH DIGITAL TWIN · FILL_PEN_HOLDER
Xiaomi_R1 · 四支全部入筒 · SUCCESSACT · 持筒停滞 0/4 · TIMEOUT

同一张任务图回放两条 GPU 仿真轨迹:一条完成插入与计分链路,另一条在瓶颈处重复运行直至超时。点击可查看交互式任务图。

3 tasks101+ trajectories12 audited frames
Overview

从轨迹视频
到可检查的运行路径

Technical framework · Graph × Visualization

运行、任务图与评测指标

Connector 接入运行,Graph 记录任务与运行关系,Visualization 展示差异;结果可用于选型、门禁、数据采集和复测。

LIVE · 已有证据NEXT · 近期产品化VISION · 长期网络
ZIWU 从高维任务现实,经语义任务图、任务地形与度量坐标,到评估、诊断和改进的技术框架

图中将 Agent、机器人和世界模型运行统一为事件,并映射到语义任务图、任务地形和度量坐标;结果保留版本、视频、action 和原生输出来源。

  1. LIVE01 · Connector接入异构运行

    Task / Robot / Policy / Episode

  2. LIVE02 · Graph记录指标、失败与证据

    Metric / Failure / Evidence

  3. LIVE03 · Visualization展示工作流与回放

    Workflow / Landscape / Replay

  4. NEXT04 · Decision将证据接入决策流程

    Match / Gate / Route / Retest

  5. VISION05 · Physical Track扩展到真实测试网络

    Test Cell → Robot Town

评测结果用于后续部署、训练和复测。

Evidence review

从视频回放到问题定位

03

Cohort comparison

将同任务的 101 条轨迹按可追溯行为分组,并区分 demo 与 policy truth。

02

Timeline review

Goal、当前状态、目标距离和中文说明沿时间轴同步显示。

01

Synchronized evidence

三路相机、逐步 action、原生 score 与运行 manifest 对齐到同一个 step。

Decision support

从 success 指标到 CI 质量门禁

G5

Deployment gate · PLANNED

规划将成功率、执行成本和经验证的过程指标用于发布门禁;当前尚未形成完整闭环。

G3

Regression detection

对终点相似的运行,比较耗时、路径、方向反转和低活动步。

G1

Infrastructure status

基础设施 pass 仅表示环境可运行,与 policy success 分开记录。

01 · Long-Horizon 主 Demo

同一任务,终点相似,运行过程不同

任务要求把四个蛋放入蛋盒、关盖并让机器人回到原位。两个官方示教以真实速度同步起播:Episode 2 在 10.80 秒结束,Episode 54 还要继续 18.64 秒。

耗时更短、路径更短Official demo · Episode 2
270 frames · 25 FPS视频 10.80 s
终点相似,耗时更长Official demo · Episode 54
736 frames · 25 FPS视频 29.44 s
0.00 s
对照要点

两次运行耗时分别为 10.80 秒和 29.44 秒。同步多视角回放用于核对额外动作发生在哪个阶段,并将耗时、动作路径、方向反转和低活动步记录为可复测指标。

02 · 系统记录了什么

同时比较任务结果与执行过程

绿色代表 Episode 2,橙色代表 Episode 54。全部数字来自官方示教视频与 14 维 action;没有 ground truth 的成功分不会填成 0 或 100。

Episode 2Episode 54本组指标均为 ↓ 越低越好
示教时长三路视频从第一帧到最后一帧;25 FPS
10.80 s
29.44 s
↓ 越低越好快 63.3%
动作空间路径14 维 action 相邻步 L2 变化量总和,不是米
24.00
29.78
↓ 越低越好少 19.4%
方向反转各关节动作增量变号次数;是来回修正代理,不是语义重试
850
2,533
↓ 越低越好少 66.4%
低活动步相邻 14 维 action 变化 L2 < 0.01;是停滞代理
3 · 1.1%
123 · 16.7%
↓ 越低越好3 vs 123
逐步动作活动度

长程差异体现在整个运行过程

每根柱子聚合一段 14 维 action 的相邻变化量。点击柱子可以跳回相应视频时间;Episode 54 的时间轴横跨 29.44 秒,因此相似终点背后的额外等待与反复修正仍可检查。

Episode 2
Episode 54
03 · 第二案例:细微退化

差异不总是 2.73×;小退化也值得在上线前被发现

之前的 Fold Clothes 官方示教没有删除。它现在承担更合适的角色:展示肉眼更难稳定识别的 4%–10% 级质量差异。

Fold Clothes Episode 36 最终头部视角
Episode 3612.00 s · action path 27.19
Fold Clothes Episode 93 最终头部视角
Episode 9312.52 s · action path 30.23
SUBTLE REGRESSION10.1%

Episode 36 的动作空间路径更短;同时快 4.2%,最终轮廓矩形度代理高 5.9%。这组差异幅度较小,可用于说明持续评测与回归检测的作用。

下载 Fold Clothes 报告
04 · 这些指标用于什么

面向视频数据的运行分析

01

减少 Demo 偏差

单次演示不足以描述部署质量。Anchor 保留完整 run、失败样本和 cohort 分布。

02

发现过程退化

新 policy 仍然成功,却变慢、绕路、抖动或依赖更多修正;success rate 无法单独反映这些过程变化。

03

把质量接入 CI

同任务、同 seed、同 rubric 自动对比,让性能退化在合并前被检测,而不是上线后才暴露。

04

形成数据飞轮

失败定位和高质量轨迹筛选反向指导数据采集、policy 训练与下一轮评测。

05 · 证据边界

区分示教素材、policy run 与结论

本节列出各类证据可以支持和不能支持的结论。

证据事实可用于
Fill Egg Holder · Official Teleop demos两条官方训练示教;最终帧呈现关盖外观;官方 score 未重跑强差异质量对照 Demo
Fold Clothes · Official DateGen demos两条官方训练示教;4%–10% 级过程与视觉代理差异;官方 score 未重跑细微退化检测 Demo
Fill Pen Holder · ACT policy run真实 GPU,success=false,score=0;人工猜测阶段标签已撤回失败诊断 / 基础设施 smoke
本页已有证据
  • 两条蛋盒官方示教可被三视角同步回放
  • 逐步 action 可计算时长、路径、反转与低活动步
  • 强差异与细微退化能进入同一质量账本
  • 系统可以区分“终点相似,但过程质量不同”
本页不支持以下结论
  • 这两条是两个 policy 的同 seed / 同 layout A/B
  • 两条都取得 RoboDojo 官方满分
  • 反转与低活动步等同于人工标注的重试或停滞
  • 两条样本足以证明跨 seed 稳健性
下一步对照实验

同任务、同 seed、两个 policy 都通过官方成功门槛,再比较执行过程

在控制任务、种子和场景条件后,进行可复现的策略对比。

  1. 01锁定同一 task / seed / layout / assets
  2. 02两个 policy 均通过官方 score gate
  3. 03比较时间、路径、重试、平滑度和最终质量
  4. 04至少 3 seeds,形成置信区间与回归门禁
数据来源

页面数字附有原始数据来源