{"generatedAt":"2026-09-13T04:31:08.336Z","tasks":[{"id":"benchmark-datasets.cases","slug":"benchmark-datasets/cases","title":"Benchmark Dataset Cases","summary":"Inspect benchmark Case membership, coverage traces, references, and scoped bulk actions.","kind":"task","productArea":"benchmark_datasets","productAreaLabel":"Benchmark Datasets","intent":"task","tier":"search-only","status":"stable","url":"/docs/benchmark-datasets/cases","related":["benchmark-datasets.overview","benchmark-datasets.representation","assets.cases","expert-contributions.request"]},{"id":"benchmark-datasets.representation","slug":"benchmark-datasets/representation","title":"Dataset Representation","summary":"Analyze how distinct benchmark Cases are distributed across facets, evaluator rules, and provenance.","kind":"task","productArea":"benchmark_datasets","productAreaLabel":"Benchmark Datasets","intent":"task","tier":"search-only","status":"stable","url":"/docs/benchmark-datasets/representation","related":["benchmark-datasets.overview","benchmark-datasets.cases","coverage-management.overview","coverage.dimensions-ontology","coverage.project-topics"]},{"id":"benchmark-datasets.snapshots","slug":"benchmark-datasets/snapshots","title":"Dataset Snapshots","summary":"Freeze Cases, evaluator links, and representation facts as an immutable benchmark evidence boundary.","kind":"task","productArea":"benchmark_datasets","productAreaLabel":"Benchmark Datasets","intent":"task","tier":"search-only","status":"stable","url":"/docs/benchmark-datasets/snapshots","related":["benchmark-datasets.overview","benchmark-evaluations.run","governance.reproducibility"]},{"id":"benchmark-evaluations.arena-rankings","slug":"benchmark-evaluations/arena-and-rankings","title":"Arena and Rankings","summary":"Interpret pairwise candidate disagreement, governed metric families, repeated-sampling ranks, and uncertainty.","kind":"task","productArea":"benchmark_evaluations","productAreaLabel":"Benchmark Evaluations","intent":"task","tier":"search-only","status":"stable","url":"/docs/benchmark-evaluations/arena-and-rankings","related":["benchmark-evaluations.overview","benchmark-evaluations.compare","benchmark-evaluations.inspect"]},{"id":"benchmark-evaluations.compare","slug":"benchmark-evaluations/compare","title":"Compare Harness Versions","summary":"Compare two or more saved Harness Versions in a symmetric evidence matrix across Cases, evaluators, and Coverage Facets.","kind":"task","productArea":"benchmark_evaluations","productAreaLabel":"Benchmark Evaluations","intent":"task","tier":"search-only","status":"stable","url":"/docs/benchmark-evaluations/compare","related":["benchmark-evaluations.overview","benchmark-evaluations.inspect","benchmark-evaluations.arena-rankings"]},{"id":"benchmark-evaluations.inspect","slug":"benchmark-evaluations/inspect-results","title":"Inspect Evaluation Results","summary":"Trace Dashboard and List signals to Run, Case, Policy, Rubric, completeness, and telemetry evidence.","kind":"task","productArea":"benchmark_evaluations","productAreaLabel":"Benchmark Evaluations","intent":"task","tier":"search-only","status":"stable","url":"/docs/benchmark-evaluations/inspect-results","related":["benchmark-evaluations.overview","benchmark-evaluations.arena-rankings","benchmark-evaluations.compare"]},{"id":"benchmark-evaluations.output-mapping","slug":"benchmark-evaluations/output-mapping","title":"Map External Evaluation Outputs","summary":"Import reference outputs, map them to immutable benchmark Cases and attempts, and inspect the resulting output-only Run.","kind":"task","productArea":"benchmark_evaluations","productAreaLabel":"Benchmark Evaluations","intent":"task","tier":"search-only","status":"stable","url":"/docs/benchmark-evaluations/output-mapping","related":["benchmark-evaluations.overview","benchmark-evaluations.inspect","benchmark-datasets.snapshots"]},{"id":"benchmark-evaluations.run","slug":"benchmark-evaluations/run-evaluation","title":"Run a Benchmark Evaluation","summary":"Launch exact active Harness Versions against an immutable Benchmark Version as standard or repeated Run Groups.","kind":"task","productArea":"benchmark_evaluations","productAreaLabel":"Benchmark Evaluations","intent":"task","tier":"primary-nav","status":"stable","url":"/docs/benchmark-evaluations/run-evaluation","related":["benchmark-evaluations.overview","benchmark-evaluations.execution-settings","benchmark-evaluations.inspect"]},{"id":"correctness.binary-rubrics","slug":"correctness-governance/binary-rubrics","title":"Write Binary Rubrics","summary":"Write atomic pass-or-fail criteria grounded in governed policies, applicable cases, and observable candidate behavior.","kind":"task","productArea":"correctness_governance","productAreaLabel":"Correctness Governance","intent":"task","tier":"search-only","status":"stable","url":"/docs/correctness-governance/binary-rubrics","related":["correctness.overview","correctness.policies-rubrics","object-model.rubrics"]},{"id":"coverage.coverage-gaps","slug":"coverage-engineering/coverage-gaps","title":"Coverage Gaps","summary":"Find missing or underrepresented behavior areas before benchmark evidence becomes misleading.","kind":"task","productArea":"coverage_engineering","productAreaLabel":"Coverage Engineering","intent":"task","tier":"search-only","status":"stable","url":"/docs/coverage-engineering/coverage-gaps","related":["coverage.dimensions-ontology","coverage.case-pool","coverage.refresh"]},{"id":"coverage.refresh","slug":"coverage-engineering/coverage-refresh","title":"Refresh coverage after product change","summary":"Reconcile coverage facets, Cases, benchmark membership, and Snapshots after the target system or its evidence changes.","kind":"task","productArea":"coverage_engineering","productAreaLabel":"Coverage Engineering","intent":"task","tier":"search-only","status":"stable","url":"/docs/coverage-engineering/coverage-refresh","related":["intro.correctness-lifecycle","coverage.coverage-gaps","governance.versioning-staleness"]},{"id":"coverage.create-benchmark","slug":"coverage-engineering/create-a-benchmark","title":"Create a benchmark","summary":"Create the durable Benchmark workspace in which you will define coverage, select Cases, and create reproducible Snapshots.","kind":"task","productArea":"coverage_engineering","productAreaLabel":"Coverage Engineering","intent":"task","tier":"search-only","status":"stable","url":"/docs/coverage-engineering/create-a-benchmark","related":["coverage.benchmarks","coverage.plan-benchmark-coverage","coverage.case-pool"]},{"id":"coverage.generate-dimension-schema","slug":"coverage-engineering/generate-dimension-schema","title":"Generate a dimension schema","summary":"Ask Teammately for coverage-dimension proposals, then accept only the dimensions and ontology values that describe meaningful behavior.","kind":"task","productArea":"coverage_engineering","productAreaLabel":"Coverage Engineering","intent":"task","tier":"search-only","status":"stable","url":"/docs/coverage-engineering/generate-dimension-schema","related":["coverage.dimensions-ontology","concepts.dimensions-ontology","troubleshooting.dimension-classification"]},{"id":"coverage.plan-benchmark-coverage","slug":"coverage-engineering/plan-benchmark-coverage","title":"Plan Benchmark Coverage","summary":"Apply project Coverage Facets to one benchmark, inspect representation, and turn important gaps into concrete case or contribution work.","kind":"task","productArea":"coverage_engineering","productAreaLabel":"Coverage Engineering","intent":"task","tier":"primary-nav","status":"stable","url":"/docs/coverage-engineering/plan-benchmark-coverage","related":["coverage.overview","coverage-management.overview","benchmark-datasets.overview"]},{"id":"coverage.synthesize-cases","slug":"coverage-engineering/synthesize-cases","title":"Synthesize cases","summary":"Generate candidate cases to fill coverage gaps before adding them to benchmarks or curated datasets.","kind":"task","productArea":"coverage_engineering","productAreaLabel":"Coverage Engineering","intent":"task","tier":"search-only","status":"stable","url":"/docs/coverage-engineering/synthesize-cases","related":["coverage.case-pool","coverage.plan-benchmark-coverage","concepts.dimensions-ontology"]},{"id":"coverage-management.case-foundry","slug":"coverage-management/case-foundry","title":"Case Foundry","summary":"Generate or update bounded case candidates from the saved coverage setup and Story map.","kind":"task","productArea":"coverage_management","productAreaLabel":"Coverage Management","intent":"task","tier":"search-only","status":"stable","url":"/docs/coverage-management/case-foundry","related":["coverage-management.coverage-stories","coverage-management.case-review","benchmark-datasets.cases"]},{"id":"coverage-management.case-review","slug":"coverage-management/case-review","title":"Case Review","summary":"Prepare, inspect, refine, and admit Case candidates and generated materials into the benchmark dataset.","kind":"task","productArea":"coverage_management","productAreaLabel":"Coverage Management","intent":"task","tier":"search-only","status":"stable","url":"/docs/coverage-management/case-review","related":["coverage-management.case-foundry","coverage-management.coverage-stories","benchmark-datasets.cases"]},{"id":"coverage-management.coverage-stories","slug":"coverage-management/coverage-stories","title":"Coverage Stories","summary":"Organize benchmark coverage intent into governed Stories and testable facet tuples.","kind":"task","productArea":"coverage_management","productAreaLabel":"Coverage Management","intent":"task","tier":"search-only","status":"stable","url":"/docs/coverage-management/coverage-stories","related":["coverage-management.overview","coverage-management.get-started","coverage-management.case-foundry","coverage-management.case-review"]},{"id":"coverage-management.get-started","slug":"coverage-management/get-started","title":"Set Up Benchmark Coverage","summary":"Define benchmark intent, facet handling, artifact preferences, and evidence requirements before generating coverage work.","kind":"task","productArea":"coverage_management","productAreaLabel":"Coverage Management","intent":"task","tier":"search-only","status":"stable","url":"/docs/coverage-management/get-started","related":["coverage-management.overview","coverage-management.coverage-stories","coverage.dimensions-ontology","coverage.project-topics"]},{"id":"expert-contributions.complete","slug":"expert-contributions/complete-contribution","title":"Complete an Expert Contribution","summary":"Work through form, chat, interview, case-review, and checkpoint tasks while keeping specialist judgment attributable.","kind":"task","productArea":"expert_contributions","productAreaLabel":"Expert Contributions","intent":"task","tier":"search-only","status":"stable","url":"/docs/expert-contributions/complete-contribution","related":["expert-contributions.overview","expert-contributions.request","expert-contributions.artifacts"]},{"id":"expert-contributions.request","slug":"expert-contributions/request-contribution","title":"Request an Expert Contribution","summary":"Create a focused benchmark contribution with an accountable expert, clear objectives, selected cases, attachments, and appropriate task components.","kind":"task","productArea":"expert_contributions","productAreaLabel":"Expert Contributions","intent":"task","tier":"primary-nav","status":"stable","url":"/docs/expert-contributions/request-contribution","related":["expert-contributions.overview","expert-contributions.complete","agent-setup.overview"]},{"id":"orientation.end-to-end","slug":"getting-oriented/operating-teammately-end-to-end","title":"Operating Teammately end to end","summary":"Operate the current product from project foundations through benchmark coverage, expert contribution, evaluation, and improvement.","kind":"task","productArea":"operating_manual","productAreaLabel":"Operating Manual","intent":"task","tier":"secondary-index","status":"stable","url":"/docs/getting-oriented/operating-teammately-end-to-end","related":["orientation.product-map","product-loop","operating.task-index"]},{"id":"governance.conflict-resolution","slug":"governance/conflict-resolution","title":"Resolve conflicting correctness evidence","summary":"Reconcile disagreement without hiding the Cases, expert judgments, sources, or versions that produced it.","kind":"task","productArea":"governance","productAreaLabel":"Governance and Reproducibility","intent":"task","tier":"search-only","status":"stable","url":"/docs/governance/conflict-resolution","related":["governance.human-approval-boundaries","expert-contributions.artifacts","object-model.versions-staleness-resolution"]},{"id":"governance.staleness-detection","slug":"governance/staleness-detection","title":"Detect and route stale correctness evidence","summary":"Identify which current claims need review after Cases, standards, coverage, sources, or target behavior change.","kind":"task","productArea":"governance","productAreaLabel":"Governance and Reproducibility","intent":"task","tier":"search-only","status":"stable","url":"/docs/governance/staleness-detection","related":["governance.versioning-staleness","assets.comparison-directions","coverage.refresh"]},{"id":"improve.start-session","slug":"improve/start-improvement-session","title":"Start an Improvement Session","summary":"Start from benchmark evidence, prepare a measurable Goal Contract, and choose bounded Work or Evolve behavior.","kind":"task","productArea":"improve","productAreaLabel":"Improve","intent":"task","tier":"primary-nav","status":"stable","url":"/docs/improve/start-improvement-session","related":["improve.overview","benchmark-evaluations.inspect","assets.harnesses"]},{"id":"improve.work-evolve","slug":"improve/work-and-evolve","title":"Work and Evolve","summary":"Choose bounded implementation work or multi-branch evolutionary search with explicit epoch and provider authorization.","kind":"task","productArea":"improve","productAreaLabel":"Improve","intent":"task","tier":"search-only","status":"stable","url":"/docs/improve/work-and-evolve","related":["improve.start-session","improve.goal-contracts","improve.chronology-trajectories"]},{"id":"integrations.check-candidate-correctness","slug":"integrations/check-candidate-correctness","title":"Check candidate correctness","summary":"Use Teammately benchmark evidence to compare a candidate behavior change against a baseline before internal human review.","kind":"recipe","productArea":"benchmark_evaluations","productAreaLabel":"Benchmark Evaluations","intent":"playbook","tier":"search-only","status":"stable","url":"/docs/integrations/check-candidate-correctness","related":["coverage.benchmark-snapshots","benchmark-evaluations.run","benchmark-evaluations.compare","improve.overview"]},{"id":"integrations.connect-model-outputs","slug":"integrations/connect-model-outputs","title":"Connect Model Outputs","summary":"Map externally produced outputs to immutable Benchmark Cases and create an output-only reference Run.","kind":"task","productArea":"benchmark_evaluations","productAreaLabel":"Benchmark Evaluations","intent":"task","tier":"search-only","status":"stable","url":"/docs/integrations/connect-model-outputs","related":["benchmark-evaluations.output-mapping","benchmark-evaluations.run","benchmark-datasets.snapshots","troubleshooting.output-mapping"]},{"id":"integrations.import-case-examples","slug":"integrations/import-case-examples","title":"Import Case Examples","summary":"Bring real product behavior examples into a Project and reconcile them against Project Input Schema before benchmark use.","kind":"task","productArea":"data_integrations","productAreaLabel":"Data Integrations","intent":"task","tier":"search-only","status":"stable","url":"/docs/integrations/import-case-examples","related":["operating.import-prepare-cases","project-settings.input-schema","assets.cases","troubleshooting.dataset-upload"]},{"id":"operating.build-policies-rubrics","slug":"operating-manual/build-policies-and-rubrics","title":"Build policies and rubrics","summary":"Materialize expert-grounded behavior rules, applicability, and binary criteria in Correctness Governance.","kind":"task","productArea":"operating_manual","productAreaLabel":"Operating Manual","intent":"task","tier":"primary-nav","status":"stable","url":"/docs/operating-manual/build-policies-and-rubrics","related":["correctness.overview","concepts.correctness-elicitation","expert-contributions.artifacts"]},{"id":"operating.first-correctness-loop","slug":"operating-manual/first-correctness-loop","title":"First correctness loop","summary":"Complete one traceable path from project context and benchmark coverage to expert judgment, evaluation evidence, and improvement.","kind":"task","productArea":"operating_manual","productAreaLabel":"Operating Manual","intent":"task","tier":"primary-nav","status":"stable","url":"/docs/operating-manual/first-correctness-loop","related":["quickstart.product","product-loop","operating.task-index"]},{"id":"operating.import-prepare-cases","slug":"operating-manual/import-and-prepare-cases","title":"Import and prepare cases","summary":"Bring cases into the project, conform them to Project Input Schema, inspect materials, and prepare benchmark selection.","kind":"task","productArea":"operating_manual","productAreaLabel":"Operating Manual","intent":"task","tier":"search-only","status":"stable","url":"/docs/operating-manual/import-and-prepare-cases","related":["assets.cases","project-settings.input-schema","benchmark-datasets.overview"]},{"id":"operating.prepare-review-packet","slug":"operating-manual/prepare-review-packet","title":"Prepare human review context","summary":"Assemble customer-owned review context from exact evaluation, contribution, coverage, and improvement evidence.","kind":"task","productArea":"operating_manual","productAreaLabel":"Operating Manual","intent":"task","tier":"search-only","status":"stable","url":"/docs/operating-manual/prepare-review-packet","related":["benchmark-evaluations.overview","expert-contributions.overview","improve.overview"]},{"id":"playbooks.rag-benchmark","slug":"playbooks/building-correctness-benchmark-rag","title":"Building a Correctness Benchmark for a RAG System","summary":"Represent retrieval-grounded behavior through cases, context, policies, rubrics, and benchmark evidence.","kind":"recipe","productArea":"playbooks","productAreaLabel":"Playbooks","intent":"playbook","tier":"search-only","status":"stable","url":"/docs/playbooks/building-correctness-benchmark-rag","related":["coverage.plan-benchmark-coverage","agent-setup.project-context","benchmark-evaluations.inspect"]},{"id":"playbooks.customer-support-ai","slug":"playbooks/customer-support-ai","title":"Using Teammately for Customer Support AI","summary":"Govern assistant behavior where correctness depends on policy, escalation, tone, and account context.","kind":"recipe","productArea":"playbooks","productAreaLabel":"Playbooks","intent":"playbook","tier":"search-only","status":"stable","url":"/docs/playbooks/customer-support-ai","related":["playbooks.enterprise-assistant-review","object-model.applicability-logic","coverage.case-segmentation"]},{"id":"playbooks.enterprise-search","slug":"playbooks/enterprise-search","title":"Using Teammately for Enterprise Search","summary":"Build correctness standards for search and answer systems that must handle context, intent, and authority.","kind":"recipe","productArea":"playbooks","productAreaLabel":"Playbooks","intent":"playbook","tier":"search-only","status":"stable","url":"/docs/playbooks/enterprise-search","related":["playbooks.rag-benchmark","coverage.dimensions-ontology","agent-setup.project-context"]},{"id":"playbooks.coverage-gaps-before-review","slug":"playbooks/finding-coverage-gaps-before-review","title":"Finding Coverage Gaps Before Review","summary":"Use coverage dimensions, failures, and expert signals to decide where evidence is incomplete.","kind":"recipe","productArea":"playbooks","productAreaLabel":"Playbooks","intent":"playbook","tier":"search-only","status":"stable","url":"/docs/playbooks/finding-coverage-gaps-before-review","related":["coverage.coverage-gaps","coverage.plan-benchmark-coverage","benchmark-evaluations.inspect"]},{"id":"playbooks.conflicting-expert-opinions","slug":"playbooks/handling-conflicting-expert-opinions","title":"Handling Conflicting Expert Opinions","summary":"Turn expert disagreement into sharper standards instead of unresolved review noise.","kind":"recipe","productArea":"playbooks","productAreaLabel":"Playbooks","intent":"playbook","tier":"search-only","status":"stable","url":"/docs/playbooks/handling-conflicting-expert-opinions","related":["governance.conflict-resolution","expert-contributions.complete","governance.human-approval-boundaries"]},{"id":"playbooks.policy-heavy-ai-systems","slug":"playbooks/policy-heavy-ai-systems","title":"Using Teammately for Policy-Heavy AI Systems","summary":"Govern AI behavior where correctness depends on many explicit rules and boundary cases.","kind":"recipe","productArea":"playbooks","productAreaLabel":"Playbooks","intent":"playbook","tier":"search-only","status":"stable","url":"/docs/playbooks/policy-heavy-ai-systems","related":["correctness.policies-rubrics","object-model.applicability-logic","expert-contributions.complete"]},{"id":"playbooks.benchmark-refresh","slug":"playbooks/refreshing-a-benchmark-from-new-signals","title":"Refreshing a Benchmark from New Signals","summary":"Update benchmark coverage and standards when new cases, review findings, or product changes appear.","kind":"recipe","productArea":"playbooks","productAreaLabel":"Playbooks","intent":"playbook","tier":"search-only","status":"stable","url":"/docs/playbooks/refreshing-a-benchmark-from-new-signals","related":["coverage.refresh","governance.staleness-detection","governance.versioning-staleness"]},{"id":"playbooks.enterprise-assistant-review","slug":"playbooks/running-expert-contributions-enterprise-assistant","title":"Running Expert Contributions for an Enterprise Assistant","summary":"Collect expert judgment for assistants that must follow product, domain, and policy expectations.","kind":"recipe","productArea":"playbooks","productAreaLabel":"Playbooks","intent":"playbook","tier":"search-only","status":"stable","url":"/docs/playbooks/running-expert-contributions-enterprise-assistant","related":["expert-contributions.complete","expert-contributions.request","governance.human-approval-boundaries"]},{"id":"playbooks.expert-judgment-to-standards","slug":"playbooks/turning-expert-judgment-into-policies-and-rubrics","title":"Turning Expert Judgment into Policies and Rubrics","summary":"Convert specialist judgment into explicit, versioned, and testable correctness standards.","kind":"recipe","productArea":"playbooks","productAreaLabel":"Playbooks","intent":"playbook","tier":"search-only","status":"stable","url":"/docs/playbooks/turning-expert-judgment-into-policies-and-rubrics","related":["concepts.correctness-elicitation","expert-contributions.overview","correctness.binary-rubrics"]},{"id":"playbooks.alongside-existing-evals","slug":"playbooks/using-teammately-alongside-existing-evaluation-infrastructure","title":"Using Teammately Alongside Existing Evaluation Infrastructure","summary":"Position Teammately as correctness infrastructure that can complement existing tests and metrics.","kind":"recipe","productArea":"playbooks","productAreaLabel":"Playbooks","intent":"playbook","tier":"search-only","status":"stable","url":"/docs/playbooks/using-teammately-alongside-existing-evaluation-infrastructure","related":["intro.product-boundaries","integrations.overview","object-model.benchmarks"]},{"id":"quickstart.product","slug":"quickstart","title":"Product quickstart","summary":"Configure one project foundation, one benchmark slice, one expert contribution, one evaluation, and one evidence-backed improvement.","kind":"quickstart","productArea":"introduction","productAreaLabel":"Learning Manual","intent":"task","tier":"primary-nav","status":"stable","url":"/docs/quickstart","related":["intro.what-is-teammately","product-loop","agent-setup.overview","expert-contributions.overview","benchmark-evaluations.overview"]}]}