"A score I could not trust was worse than no score at all, so I learned to grade myself without cheating."
An Honestly Graded Embodied AI Agent
Placeholder chapter page. Sections are produced by the book-skills pipeline.
Sections
- 65.1 Task metrics vs operational metrics
- 65.2 User/site/device/session splits
- 65.3 Time-aware cross-validation
- 65.4 Rare-event and imbalanced evaluation
- 65.5 Robustness to missing and faulty sensors
- 65.6 Calibration and uncertainty metrics
- 65.7 Reproducibility and field-validation protocols
Lab 65
write an evaluation harness that reports standard metrics plus device/site/generalization breakdowns.