{"query":"Benchmark Run Metadata","corpusVersion":"local","generatedAt":"2026-09-13T04:37:19.434Z","results":[{"blockId":"benchmark-evaluations.run-metadata#benchmark-run-metadata","pageId":"benchmark-evaluations.run-metadata","title":"Benchmark Run Metadata","pageTitle":"Benchmark Run Metadata","url":"https://teammately.ai/docs/benchmark-evaluations/run-metadata.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/run-metadata#benchmark-run-metadata","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/run-metadata.md","sectionId":"benchmark-run-metadata","kind":"reference","productArea":"benchmark_evaluations","score":2063.911591225713,"reasons":["search_match","title_match","display_title_match","term_match"],"markdown":"# Benchmark Run Metadata"},{"blockId":"benchmark-evaluations.overview#benchmark-evaluations","pageId":"benchmark-evaluations.overview","title":"Benchmark Evaluations","pageTitle":"Benchmark Evaluations","url":"https://teammately.ai/docs/benchmark-evaluations.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations#benchmark-evaluations","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations.md","sectionId":"benchmark-evaluations","kind":"concept","productArea":"benchmark_evaluations","score":652.7743040955927,"reasons":["search_match","term_match","prefix_or_fuzzy_match"],"markdown":"# Benchmark Evaluations\n\nBenchmark Evaluations is the version-scoped workspace for executing and comparing candidate systems. The active top-level tabs are **Dashboard**, **List**, **Arena**, and **Compare**. Every managed Run binds an exact saved Harness Version to the immutable Benchmark Version shown in the route.\n\n> Evaluation boundary\n>\n> Interpret evidence inside its recorded Benchmark Version, Harness Version, Run or Run Group, evaluator set, and metadata. Run counts belong to launches. Additional launches add evidence without rewriting earlier Runs."},{"blockId":"benchmark-evaluations.run-metadata#fields-states-or-lifecycle-rules","pageId":"benchmark-evaluations.run-metadata","title":"Fields, states, or lifecycle rules","pageTitle":"Benchmark Run Metadata","url":"https://teammately.ai/docs/benchmark-evaluations/run-metadata.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/run-metadata#fields-states-or-lifecycle-rules","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/run-metadata.md","sectionId":"fields-states-or-lifecycle-rules","kind":"reference","productArea":"benchmark_evaluations","score":628.096238374234,"reasons":["search_match","page_title_match","term_match","prefix_or_fuzzy_match"],"markdown":"## Fields, states, or lifecycle rules\n\n- Metadata describes a benchmark evaluation context; it is not a Policy, Rubric, Case, Harness Version, Benchmark Version, or Regime Version.\n- Existing Runs retain the metadata and exact version identities recorded with their evidence.\n- Benchmark-level fields can be managed from the benchmark context when that surface exposes the control.\n- External model configuration is declared when the Run is created rather than through a project-level template.\n- Metadata can help compare or interpret Runs, but it does not make an external metric a Teammately-verified result."},{"blockId":"benchmark-evaluations.run-metadata#definition","pageId":"benchmark-evaluations.run-metadata","title":"Definition","pageTitle":"Benchmark Run Metadata","url":"https://teammately.ai/docs/benchmark-evaluations/run-metadata.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/run-metadata#definition","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/run-metadata.md","sectionId":"definition","kind":"reference","productArea":"benchmark_evaluations","score":625.6951372843353,"reasons":["search_match","page_title_match","term_match"],"markdown":"## Definition\n\nBenchmark Run Metadata is descriptive context attached to benchmark-level evaluation work. It helps operators interpret a Run without replacing the exact Benchmark Version, Harness Version, Run Group, or published Regime Version that defines the evidence boundary.\n\nProject-level Run Metadata templates are retired. When the current evaluation surface offers metadata fields, manage them at the benchmark or Run setup boundary and keep the values specific to the evidence being created."},{"blockId":"benchmark-evaluations.run-metadata#choose-the-right-boundary","pageId":"benchmark-evaluations.run-metadata","title":"Choose the right boundary","pageTitle":"Benchmark Run Metadata","url":"https://teammately.ai/docs/benchmark-evaluations/run-metadata.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/run-metadata#choose-the-right-boundary","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/run-metadata.md","sectionId":"choose-the-right-boundary","kind":"reference","productArea":"benchmark_evaluations","score":625.3631514413595,"reasons":["search_match","page_title_match","term_match","prefix_or_fuzzy_match"],"markdown":"## Choose the right boundary\n\nPut executable candidate behavior in a Harness and its saved Version. Put Case content and materials in Assets and Benchmark Datasets. Put evaluation scoring behavior in the published Regime and governed Policies and Rubrics. Use Run Metadata only for descriptive context that should travel with a particular benchmark evaluation.\n\n{% example-demo title=\"Example: benchmark-level experiment context\" %}\nTwo Runs use the same Benchmark Version but different saved Harness Versions. Their benchmark-level metadata records the experiment labels and external model configuration needed to interpret the comparison. The metadata does not change either candidate identity or the published Regime used to score the evidence.\n{% /example-demo %}"},{"blockId":"benchmark-evaluations.run-metadata#source-confidence","pageId":"benchmark-evaluations.run-metadata","title":"Source confidence","pageTitle":"Benchmark Run Metadata","url":"https://teammately.ai/docs/benchmark-evaluations/run-metadata.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/run-metadata#source-confidence","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/run-metadata.md","sectionId":"source-confidence","kind":"reference","productArea":"benchmark_evaluations","score":617.6867109941044,"reasons":["search_match","page_title_match","term_match"],"markdown":"## Source confidence\n\nCode-backed: the current Run presentation and setup surface expose benchmark-level metadata context and explicitly fence off retired project-level templates. Exact fields depend on the benchmark evaluation surface in use."},{"blockId":"troubleshooting.benchmark-runs#benchmark-run-troubleshooting","pageId":"troubleshooting.benchmark-runs","title":"Benchmark run troubleshooting","pageTitle":"Benchmark run troubleshooting","url":"https://teammately.ai/docs/troubleshooting/benchmark-runs.md","humanUrl":"https://teammately.ai/docs/troubleshooting/benchmark-runs#benchmark-run-troubleshooting","markdownUrl":"https://teammately.ai/docs/troubleshooting/benchmark-runs.md","sectionId":"benchmark-run-troubleshooting","kind":"error","productArea":"troubleshooting","score":611.8282620989523,"reasons":["search_match","term_match","prefix_or_fuzzy_match"],"markdown":"# Benchmark run troubleshooting"},{"blockId":"benchmark-evaluations.run#run-a-benchmark-evaluation","pageId":"benchmark-evaluations.run","title":"Run a Benchmark Evaluation","pageTitle":"Run a Benchmark Evaluation","url":"https://teammately.ai/docs/benchmark-evaluations/run-evaluation.md","humanUrl":"https://teammately.ai/docs/benchmark-evaluations/run-evaluation#run-a-benchmark-evaluation","markdownUrl":"https://teammately.ai/docs/benchmark-evaluations/run-evaluation.md","sectionId":"run-a-benchmark-evaluation","kind":"task","productArea":"benchmark_evaluations","score":605.1231181838976,"reasons":["search_match","term_match","prefix_or_fuzzy_match"],"markdown":"# Run a Benchmark Evaluation\n\nLaunch a managed evaluation when the immutable Benchmark Version, governed evaluators, and candidate runtimes are ready."}]}