{"query":"Compare Harness Versions","corpusVersion":"local","generatedAt":"2026-09-13T04:36:54.343Z","results":[{"blockId":"benchmark-evaluations.compare#compare-harness-versions","pageId":"benchmark-evaluations.compare","title":"Compare Harness Versions","pageTitle":"Compare Harness Versions","url":"https://teammately.ai/docs/benchmark-evaluations/compare.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/compare#compare-harness-versions","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/compare.md","sectionId":"compare-harness-versions","kind":"task","productArea":"benchmark_evaluations","score":2489.368845545789,"reasons":["search_match","title_match","display_title_match","term_match"],"markdown":"# Compare Harness Versions\n\nCompare shows aggregate observed evidence for saved Harness Versions. Choose the Versions, compatible evaluation configuration, and measurement to compare. Use **Inspect individual Run comparisons** for the detailed result matrix."},{"blockId":"benchmark-evaluations.compare#steps","pageId":"benchmark-evaluations.compare","title":"Steps","pageTitle":"Compare Harness Versions","url":"https://teammately.ai/docs/benchmark-evaluations/compare.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/compare#steps","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/compare.md","sectionId":"steps","kind":"task","productArea":"benchmark_evaluations","score":787.7299354163993,"reasons":["search_match","page_title_match","term_match","prefix_or_fuzzy_match"],"markdown":"## Steps\n\n1. Confirm the immutable Benchmark Version and choose at least two visible Harness Versions.\n2. Select an aggregate measurement, or open individual Run comparisons and choose a row mode.\n3. Check evidence completeness for each Harness column. A blank or incomplete cell is not a failure.\n4. Locate rows with material disagreement and connect them back to Case and evaluator evidence.\n5. Preserve regressions and required-criterion failures next to gains.\n6. Use the exact candidate and row evidence when starting an Improvement Session or requesting an Expert Contribution.\n\nCompare reads existing evidence and does not mutate Runs. Selecting aggregate Harness Versions recomputes their comparison on compatible evidence; individual matrix visibility is local presentation. It does not activate Harnesses or choose a winner.\n\n{% example-demo title=\"Example: facet-local improvement\" %}\nThree Harness Versions look similar overall. The Project Topic row mode shows that Version 14 improves source-authority Topics but regresses escalation Topics. Switching to Cases identifies two regressions, and the team starts Improve with those exact failures instead of claiming a uniform improvement.\n{% /example-demo %}"},{"blockId":"benchmark-evaluations.compare#object-and-state-changes","pageId":"benchmark-evaluations.compare","title":"Object and state changes","pageTitle":"Compare Harness Versions","url":"https://teammately.ai/docs/benchmark-evaluations/compare.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/compare#object-and-state-changes","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/compare.md","sectionId":"object-and-state-changes","kind":"task","productArea":"benchmark_evaluations","score":780.2187107502765,"reasons":["search_match","page_title_match","term_match"],"markdown":"## Object and state changes\n\nCompare reads existing evidence. Selecting aggregate Versions reads their observed evidence; selecting individual matrix row modes changes presentation; it does not activate a Harness, mutate a Run, or retain a candidate."},{"blockId":"benchmark-evaluations.compare#prerequisites","pageId":"benchmark-evaluations.compare","title":"Prerequisites","pageTitle":"Compare Harness Versions","url":"https://teammately.ai/docs/benchmark-evaluations/compare.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/compare#prerequisites","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/compare.md","sectionId":"prerequisites","kind":"task","productArea":"benchmark_evaluations","score":769.9139092034413,"reasons":["search_match","page_title_match","term_match","prefix_or_fuzzy_match"],"markdown":"## Prerequisites\n\nSaved Harness Versions with evaluation results are shown for the selected Benchmark Version. Choose one or more Versions to inspect; Run counts may differ. An output-only imported reference Run cannot become a Harness column because it has no executable saved Version."},{"blockId":"benchmark-evaluations.compare#source-confidence","pageId":"benchmark-evaluations.compare","title":"Source confidence","pageTitle":"Compare Harness Versions","url":"https://teammately.ai/docs/benchmark-evaluations/compare.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/compare#source-confidence","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/compare.md","sectionId":"source-confidence","kind":"task","productArea":"benchmark_evaluations","score":768.1554297907641,"reasons":["search_match","page_title_match","term_match"],"markdown":"## Source confidence\n\nCode-backed: the active Compare route and Evaluation Matrix define Harness columns, local visibility, symmetric comparison, and the current evidence row modes."},{"blockId":"benchmark-evaluations.compare#success-criteria","pageId":"benchmark-evaluations.compare","title":"Success criteria","pageTitle":"Compare Harness Versions","url":"https://teammately.ai/docs/benchmark-evaluations/compare.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/compare#success-criteria","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/compare.md","sectionId":"success-criteria","kind":"task","productArea":"benchmark_evaluations","score":765.2363556507528,"reasons":["search_match","page_title_match","term_match","prefix_or_fuzzy_match"],"markdown":"## Success criteria\n\n- At least two exact Harness Versions share the same Benchmark Version.\n- Incomplete cells remain distinct from failed evidence.\n- Material movement resolves to Cases, evaluators, or Coverage Facets."},{"blockId":"benchmark-evaluations.compare#common-mistakes","pageId":"benchmark-evaluations.compare","title":"Common mistakes","pageTitle":"Compare Harness Versions","url":"https://teammately.ai/docs/benchmark-evaluations/compare.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/compare#common-mistakes","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/compare.md","sectionId":"common-mistakes","kind":"task","productArea":"benchmark_evaluations","score":764.2435073668471,"reasons":["search_match","page_title_match","term_match","prefix_or_fuzzy_match"],"markdown":"## Common mistakes\n\n- Comparing different Benchmark Versions as though only the candidate moved.\n- Treating missing evidence as a failed cell.\n- Reading a facet aggregate without checking the distinct Cases behind it.\n- Describing an imported output-only Run as a Harness Version.\n- Selecting the newest Version solely because it is newest."},{"blockId":"benchmark-evaluations.compare#related-reference-pages","pageId":"benchmark-evaluations.compare","title":"Related reference pages","pageTitle":"Compare Harness Versions","url":"https://teammately.ai/docs/benchmark-evaluations/compare.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/compare#related-reference-pages","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/compare.md","sectionId":"related-reference-pages","kind":"task","productArea":"benchmark_evaluations","score":753.9133189156419,"reasons":["search_match","page_title_match","term_match","prefix_or_fuzzy_match"],"markdown":"## Related reference pages\n\n{% related-card-grid title=\"Related reference pages\" %}\n- [Benchmark Evaluations](/docs/benchmark-evaluations)\n- [Arena and Rankings](/docs/benchmark-evaluations/arena-and-rankings)\n- [Harnesses](/docs/assets/harnesses)\n{% /related-card-grid %}"}]}