{"query":"Inspect Evaluation Results","corpusVersion":"local","generatedAt":"2026-09-13T04:38:56.936Z","results":[{"blockId":"benchmark-evaluations.inspect#inspect-evaluation-results","pageId":"benchmark-evaluations.inspect","title":"Inspect Evaluation Results","pageTitle":"Inspect Evaluation Results","url":"https://teammately.ai/docs/benchmark-evaluations/inspect-results.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/inspect-results#inspect-evaluation-results","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/inspect-results.md","sectionId":"inspect-evaluation-results","kind":"task","productArea":"benchmark_evaluations","score":2310.8244901413727,"reasons":["search_match","title_match","display_title_match","term_match","prefix_or_fuzzy_match"],"markdown":"# Inspect Evaluation Results"},{"blockId":"benchmark-evaluations.inspect#steps","pageId":"benchmark-evaluations.inspect","title":"Steps","pageTitle":"Inspect Evaluation Results","url":"https://teammately.ai/docs/benchmark-evaluations/inspect-results.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/inspect-results#steps","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/inspect-results.md","sectionId":"steps","kind":"task","productArea":"benchmark_evaluations","score":658.3974975333699,"reasons":["search_match","page_title_match","term_match","prefix_or_fuzzy_match"],"markdown":"## Steps\n\n1. Open Dashboard and confirm the Benchmark Version, candidate Harness Version, Run Group type, attempt count, and evaluation progress.\n2. Read rankings with their metric family and uncertainty. Distinguish average score, passed at least once, and passed every time over observed Runs. Inspect Run counts and coverage; historical group-specific pass@n and pass^n retain their original meanings.\n3. Open **List → Runs** to inspect group and Run status, output progress, evaluation progress, metadata, and available resource telemetry.\n4. Open **List → Evaluation results** for the Case summary, outcome, failed Policies, failed Rubrics, and evaluated count.\n5. Use Arena for pairwise disagreement or Compare for a Harness matrix across Cases, evaluator facts, or Coverage Facets.\n6. Classify the next action as candidate work, evaluator clarification, Case correction, coverage work, external-output remapping, or no action.\n\nThe List results surface is intentionally compact. Do not claim that it exposes full execution trajectories. The **Traces / Spans** segment currently reports a capability fence because the benchmark API does not provide evaluation execution traces."},{"blockId":"benchmark-evaluations.inspect#object-and-state-changes","pageId":"benchmark-evaluations.inspect","title":"Object and state changes","pageTitle":"Inspect Evaluation Results","url":"https://teammately.ai/docs/benchmark-evaluations/inspect-results.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/inspect-results#object-and-state-changes","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/inspect-results.md","sectionId":"object-and-state-changes","kind":"task","productArea":"benchmark_evaluations","score":653.2024071322878,"reasons":["search_match","page_title_match","term_match","prefix_or_fuzzy_match"],"markdown":"## Object and state changes\n\nInspection, filtering, and navigation are read-only. Starting Improve, a Contribution, coverage work, or a later Run creates separate durable work while preserving the inspected evidence."},{"blockId":"benchmark-evaluations.inspect#reading-incomplete-and-repeated-evidence","pageId":"benchmark-evaluations.inspect","title":"Reading incomplete and repeated evidence","pageTitle":"Inspect Evaluation Results","url":"https://teammately.ai/docs/benchmark-evaluations/inspect-results.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/inspect-results#reading-incomplete-and-repeated-evidence","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/inspect-results.md","sectionId":"reading-incomplete-and-repeated-evidence","kind":"task","productArea":"benchmark_evaluations","score":639.0176763200271,"reasons":["search_match","page_title_match","term_match","prefix_or_fuzzy_match"],"markdown":"## Reading incomplete and repeated evidence\n\nAn aggregate calculated over fewer evaluable Cases can look better while covering less evidence. Record evaluated, incomplete, and missing counts before comparing candidates. For repeated groups, inspect whether the configured number of attempts exists for every candidate and whether one failed attempt changes the metric interpretation.\n\nCost, tokens, and latency help route operational work but are nullable telemetry. Missing capture means unknown, not free or instantaneous execution.\n\n> Evaluator authority\n>\n> Policy and Rubric results are the correctness evidence admitted by the Benchmark Version. Rankings and telemetry summarize that evidence; they do not create a new standard.\n\n{% example-demo title=\"Example: apparent gain from incomplete evidence\" %}\nHarness B leads the overall table, but List shows that twelve difficult Cases are still unevaluated for B. Arena also reports incomplete pairs. The operator waits for terminal evidence instead of starting Improve from a ranking that covers a smaller Case population.\n{% /example-demo %}"},{"blockId":"benchmark-evaluations.inspect#related-troubleshooting-pages","pageId":"benchmark-evaluations.inspect","title":"Related troubleshooting pages","pageTitle":"Inspect Evaluation Results","url":"https://teammately.ai/docs/benchmark-evaluations/inspect-results.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/inspect-results#related-troubleshooting-pages","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/inspect-results.md","sectionId":"related-troubleshooting-pages","kind":"task","productArea":"benchmark_evaluations","score":633.821430169456,"reasons":["search_match","page_title_match","term_match","prefix_or_fuzzy_match"],"markdown":"## Related troubleshooting pages\n\n{% related-card-grid title=\"Related troubleshooting pages\" %}\n- [Benchmark results changed unexpectedly](/docs/troubleshooting/benchmark-results-changed-unexpectedly)\n- [Benchmark runs](/docs/troubleshooting/benchmark-runs)\n- [Missing outputs](/docs/troubleshooting/missing-outputs)\n{% /related-card-grid %}"},{"blockId":"benchmark-evaluations.inspect#prerequisites","pageId":"benchmark-evaluations.inspect","title":"Prerequisites","pageTitle":"Inspect Evaluation Results","url":"https://teammately.ai/docs/benchmark-evaluations/inspect-results.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/inspect-results#prerequisites","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/inspect-results.md","sectionId":"prerequisites","kind":"task","productArea":"benchmark_evaluations","score":630.2837656178268,"reasons":["search_match","page_title_match","term_match","prefix_or_fuzzy_match"],"markdown":"## Prerequisites\n\n- A visible Run or Run Group with output or evaluation progress.\n- Access to the exact Benchmark and Harness Version evidence.\n\nStart with completeness and identity, then move from aggregate signals to the Cases and evaluator failures that support them."},{"blockId":"benchmark-evaluations.inspect#related-reference-pages","pageId":"benchmark-evaluations.inspect","title":"Related reference pages","pageTitle":"Inspect Evaluation Results","url":"https://teammately.ai/docs/benchmark-evaluations/inspect-results.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/inspect-results#related-reference-pages","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/inspect-results.md","sectionId":"related-reference-pages","kind":"task","productArea":"benchmark_evaluations","score":627.2953664996609,"reasons":["search_match","page_title_match","term_match","prefix_or_fuzzy_match"],"markdown":"## Related reference pages\n\n{% related-card-grid title=\"Related reference pages\" %}\n- [Benchmark Evaluations](/docs/benchmark-evaluations)\n- [Arena and Rankings](/docs/benchmark-evaluations/arena-and-rankings)\n- [Dataset Snapshots](/docs/benchmark-datasets/snapshots)\n{% /related-card-grid %}"},{"blockId":"benchmark-evaluations.inspect#success-criteria","pageId":"benchmark-evaluations.inspect","title":"Success criteria","pageTitle":"Inspect Evaluation Results","url":"https://teammately.ai/docs/benchmark-evaluations/inspect-results.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/inspect-results#success-criteria","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/inspect-results.md","sectionId":"success-criteria","kind":"task","productArea":"benchmark_evaluations","score":619.7915084144765,"reasons":["search_match","page_title_match","term_match","prefix_or_fuzzy_match"],"markdown":"## Success criteria\n\n- Identity, completeness, metric family, and uncertainty are explicit.\n- Important signals resolve to Cases and admitted evaluator outcomes.\n- The next action targets the responsible artifact or candidate boundary."}]}