{"query":"Using Teammately Alongside Existing Evaluation Infrastructure","corpusVersion":"local","generatedAt":"2026-09-13T04:40:50.240Z","results":[{"blockId":"playbooks.alongside-existing-evals#using-teammately-alongside-existing-evaluation-infrastructure","pageId":"playbooks.alongside-existing-evals","title":"Using Teammately Alongside Existing Evaluation Infrastructure","pageTitle":"Using Teammately Alongside Existing Evaluation Infrastructure","url":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure.md","humanUrl":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure#using-teammately-alongside-existing-evaluation-infrastructure","markdownUrl":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure.md","sectionId":"using-teammately-alongside-existing-evaluation-infrastructure","kind":"recipe","productArea":"playbooks","score":6854.860492035866,"reasons":["search_match","title_match","term_match"],"markdown":"# Using Teammately Alongside Existing Evaluation Infrastructure\n\nUse this playbook when a team already has tests, traces, dashboards, or offline evals and wants Teammately to add expert-grounded correctness evidence rather than replace everything."},{"blockId":"playbooks.alongside-existing-evals#choose-the-integration-boundary","pageId":"playbooks.alongside-existing-evals","title":"Choose the integration boundary","pageTitle":"Using Teammately Alongside Existing Evaluation Infrastructure","url":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure.md","humanUrl":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure#choose-the-integration-boundary","markdownUrl":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure.md","sectionId":"choose-the-integration-boundary","kind":"recipe","productArea":"playbooks","score":2596.8280909773543,"reasons":["search_match","page_title_match","term_match"],"markdown":"## Choose the integration boundary\n\nUse this when existing infrastructure already owns candidate execution, CI status, traces, or metrics and the team wants Teammately to own deliberate coverage, expert-grounded standards, and Benchmark evidence. Keep external systems authoritative for facts Teammately does not ingest or compute."},{"blockId":"playbooks.alongside-existing-evals#source-confidence","pageId":"playbooks.alongside-existing-evals","title":"Source confidence","pageTitle":"Using Teammately Alongside Existing Evaluation Infrastructure","url":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure.md","humanUrl":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure#source-confidence","markdownUrl":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure.md","sectionId":"source-confidence","kind":"recipe","productArea":"playbooks","score":2556.36466548001,"reasons":["search_match","page_title_match","term_match"],"markdown":"## Source confidence\n\nDoctrine-backed: the approved product boundary keeps Teammately correctness evidence separate from external infrastructure facts and customer decisions. Linked code-backed pages define managed Runs, output-only Runs, Run Metadata, and comparison eligibility."},{"blockId":"playbooks.alongside-existing-evals#two-supported-evidence-paths","pageId":"playbooks.alongside-existing-evals","title":"Two supported evidence paths","pageTitle":"Using Teammately Alongside Existing Evaluation Infrastructure","url":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure.md","humanUrl":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure#two-supported-evidence-paths","markdownUrl":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure.md","sectionId":"two-supported-evidence-paths","kind":"recipe","productArea":"playbooks","score":2517.2003891945556,"reasons":["search_match","page_title_match","term_match","prefix_or_fuzzy_match"],"markdown":"## Two supported evidence paths\n\n1. Inventory the external Case identity, candidate identity, metrics, CI status, and links needed by customer operators.\n2. Import representative inputs as Teammately Cases and design their coverage and governed evaluator boundary.\n3. For a candidate Teammately can execute, save it as a Harness Version and create a managed Run.\n4. For responses produced externally, export immutable Teammately Case IDs, generate one response per intended Case, and map them into an output-only Run.\n5. Store useful external candidate or run identifiers in the configured Run Metadata fields. Do not claim Teammately verified an external metric merely because its identifier is present.\n6. Inspect Teammately Rubric evidence in List. Use Compare and Arena only for saved Harness Versions; output-only Runs are not Harness columns.\n7. In customer-owned human review context, present Teammately evidence and external CI or telemetry as separately sourced facts."},{"blockId":"playbooks.alongside-existing-evals#related-docs","pageId":"playbooks.alongside-existing-evals","title":"Related docs","pageTitle":"Using Teammately Alongside Existing Evaluation Infrastructure","url":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure.md","humanUrl":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure#related-docs","markdownUrl":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure.md","sectionId":"related-docs","kind":"recipe","productArea":"playbooks","score":2513.166844747864,"reasons":["search_match","page_title_match","term_match","prefix_or_fuzzy_match"],"markdown":"## Related docs\n\n{% related-card-grid title=\"Related docs\" %}\n- [Map external outputs](/docs/benchmark-evaluations/output-mapping)\n- [Configure Run Metadata](/docs/benchmark-evaluations/run-metadata)\n- [Compare Harness Versions](/docs/benchmark-evaluations/compare)\n- [Read run results](/docs/benchmark-evaluations/inspect-results)\n- [Run a benchmark](/docs/benchmark-evaluations/run-evaluation)\n- [Importing cases](/docs/operating-manual/import-and-prepare-cases)\n- [Agent Setup](/docs/agent-setup)\n{% /related-card-grid %}"},{"blockId":"playbooks.alongside-existing-evals#ownership-matrix","pageId":"playbooks.alongside-existing-evals","title":"Ownership matrix","pageTitle":"Using Teammately Alongside Existing Evaluation Infrastructure","url":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure.md","humanUrl":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure#ownership-matrix","markdownUrl":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure.md","sectionId":"ownership-matrix","kind":"recipe","productArea":"playbooks","score":2507.95980393243,"reasons":["search_match","page_title_match","term_match"],"markdown":"## Ownership matrix\n\n| Evidence | Owning system |\n| --- | --- |\n| Coverage Facets, Policies, Rubrics, Benchmark Versions | Teammately |\n| Managed Harness response and Rubric outcomes | Teammately Run |\n| Imported response mapping and Rubric outcomes | Teammately output-only Run |\n| External latency, CI status, trace, or deployment fact | External system |\n| Downstream operational decision | Customer |\n\n{% example-demo title=\"CI benchmark handoff\" %}\nA team keeps latency and regression tests in CI. It exports Teammately Case IDs, produces candidate responses externally, and imports them as one output-only Run with the CI run ID in Run Metadata. Teammately reports must-level Policy failures for those responses; CI remains authoritative for latency. The customer's review context shows both facts with their sources and does not treat the imported candidate as a saved Harness Version.\n{% /example-demo %}"},{"blockId":"playbooks.alongside-existing-evals#evidence-to-collect","pageId":"playbooks.alongside-existing-evals","title":"Evidence to collect","pageTitle":"Using Teammately Alongside Existing Evaluation Infrastructure","url":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure.md","humanUrl":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure#evidence-to-collect","markdownUrl":"https://teammately.ai/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure.md","sectionId":"evidence-to-collect","kind":"recipe","productArea":"playbooks","score":2507.449694504553,"reasons":["search_match","page_title_match","term_match"],"markdown":"## Evidence to collect\n\n- External eval artifacts and the identifiers needed to trace candidates or runs.\n- The Teammately-owned Cases, standards, coverage, Benchmark Version, output mapping, Rubric evidence, and Run Metadata.\n- Mapping notes that explain which metrics remain outside Teammately.\n- Benchmark comparisons under approved human standards.\n- Review context that keeps external CI status separate from Teammately benchmark evidence."},{"blockId":"intro.correctness-infrastructure#from-expert-effort-to-reusable-infrastructure","pageId":"intro.correctness-infrastructure","title":"From expert effort to reusable infrastructure","pageTitle":"What is correctness infrastructure?","url":"https://teammately.ai/docs/introduction/correctness-infrastructure.md","humanUrl":"https://teammately.ai/docs/introduction/correctness-infrastructure#from-expert-effort-to-reusable-infrastructure","markdownUrl":"https://teammately.ai/docs/introduction/correctness-infrastructure.md","sectionId":"from-expert-effort-to-reusable-infrastructure","kind":"concept","productArea":"introduction","score":619.3241435444064,"reasons":["search_match","term_match"],"markdown":"## From expert effort to reusable infrastructure\n\nExpert time is most valuable when it resolves ambiguity that agents and engineers cannot settle from existing evidence. Teammately therefore prepares a structured contribution: the relevant cases, reference materials, candidate interpretations, possible policies, rubric questions, and unresolved conflicts. Once an expert responds, the contribution can affect more than the immediate task. It can refine the coverage map, materialize a policy or rubric, qualify a case, or identify the next evaluation.\n\nThis creates a higher return on expert effort. The product does not ask specialists to repeatedly label disconnected outputs; it preserves why a judgment was made and where that judgment applies."}]}