Benchmarks
-
Benchmark evaluating whether language models can generate and edit structured ASCII diagrams. 80 tasks across 4 categories, with public example tasks available on Hugging Face.3
-
A benchmark harness that runs Android agent tasks against a real phone and a real LLM, capturing phone and model performance metrics for every run.0