{
  "schema_version": "decisions-1.1",
  "status": "preliminary",
  "suite_version": "1.0.0",
  "suite_hash": "b2d7e19cbe744ee0abddb95229d1fac9b9943f04dc5ed1ef826f641872fd0f8d",
  "protocol_hash": "d41bbc49c44ec0be17b1c5d079387440663bf8c81f5510ff7b92e7068a13489e",
  "campaign_hash": "a78222959acc8e71a0a4e43fd5b8df79e52191820d2cb94a654880ca7a8ed12b",
  "recovery": {
    "reason": "Transport recovery; requests, evidence, answer keys and grading unchanged",
    "original_campaign_hash": "89ab081c0bdcbf51bdad41a1e2d27500b81e159db667745f86230f1230a28ed7",
    "original_campaign_id": "soc-decisions-mvp-001",
    "original_source_commits": [],
    "original_artifact_hash": "f681ed9c11e6d11332c85bf790a7668bc53e811c6f7d0133b99d05c8d167a54f",
    "copied_records": 410,
    "original_budget_included": true
  },
  "cases": 6,
  "families": 2,
  "items": 272,
  "categories": {
    "verdict": 18,
    "hypothesis_update": 36,
    "conclusion_check": 54,
    "evidence_relevance": 86,
    "next_step": 18,
    "model_routing": 60
  },
  "models": [
    {
      "model_id": "typesafe/jev-1.13",
      "resolved_models": [
        "typesafe/jev-1.13-20260917"
      ],
      "label": "TypeSafe: Jev 1.13",
      "backend": "openrouter_decisions",
      "provider": "typesafe",
      "effort": null,
      "repeats": 1,
      "cost_usd": 0.01963458,
      "cost_upper_bound_usd": 0.01963458,
      "mean_latency_seconds": 0.3976849303084343,
      "categories": {
        "verdict": {
          "accuracy": 100.0,
          "balanced_accuracy": 100.0,
          "constant_choice_baseline": 72.22222222222221,
          "attempts": 18,
          "invalid": 0,
          "critical_errors": 0,
          "brier": 0.02627777777777778,
          "probability_coverage": 1.0
        },
        "hypothesis_update": {
          "accuracy": 100.0,
          "balanced_accuracy": 100.0,
          "constant_choice_baseline": 72.22222222222221,
          "attempts": 36,
          "invalid": 0,
          "critical_errors": 0,
          "brier": 0.07210555555555556,
          "probability_coverage": 1.0
        },
        "conclusion_check": {
          "accuracy": 87.03703703703704,
          "balanced_accuracy": 80.55555555555556,
          "constant_choice_baseline": 66.66666666666666,
          "attempts": 54,
          "invalid": 0,
          "critical_errors": 0,
          "brier": 0.13978148148148148,
          "probability_coverage": 1.0
        },
        "evidence_relevance": {
          "accuracy": 100.0,
          "balanced_accuracy": 100.0,
          "constant_choice_baseline": 72.06349206349206,
          "attempts": 86,
          "invalid": 0,
          "critical_errors": 0,
          "brier": 0.003020930232558139,
          "probability_coverage": 1.0
        },
        "next_step": {
          "accuracy": 66.66666666666666,
          "balanced_accuracy": null,
          "constant_choice_baseline": 72.22222222222221,
          "attempts": 18,
          "invalid": 0,
          "critical_errors": 0,
          "brier": 0.12104999999999999,
          "probability_coverage": 0.2222222222222222
        },
        "model_routing": {
          "accuracy": 100.0,
          "balanced_accuracy": 100.0,
          "constant_choice_baseline": 40.0,
          "attempts": 60,
          "invalid": 0,
          "critical_errors": 0,
          "brier": 0.004874576271186442,
          "probability_coverage": 0.9833333333333333
        }
      }
    },
    {
      "model_id": "openai/gpt-5.6-sol",
      "resolved_models": [
        "openai/gpt-5.6-sol"
      ],
      "label": "OpenAI: GPT-5.6 Sol",
      "backend": "openrouter_chat",
      "provider": "openai/flex",
      "effort": "high",
      "repeats": 1,
      "cost_usd": 0.4288482,
      "cost_upper_bound_usd": 0.5379492,
      "mean_latency_seconds": 1.7953922904371746,
      "categories": {
        "verdict": {
          "accuracy": 83.33333333333333,
          "balanced_accuracy": 92.5925925925926,
          "constant_choice_baseline": 72.22222222222221,
          "attempts": 18,
          "invalid": 0,
          "critical_errors": 3,
          "brier": null,
          "probability_coverage": 0.0
        },
        "hypothesis_update": {
          "accuracy": 91.66666666666667,
          "balanced_accuracy": 96.29629629629629,
          "constant_choice_baseline": 72.22222222222221,
          "attempts": 36,
          "invalid": 0,
          "critical_errors": 0,
          "brier": null,
          "probability_coverage": 0.0
        },
        "conclusion_check": {
          "accuracy": 100.0,
          "balanced_accuracy": 100.0,
          "constant_choice_baseline": 66.66666666666666,
          "attempts": 54,
          "invalid": 0,
          "critical_errors": 0,
          "brier": null,
          "probability_coverage": 0.0
        },
        "evidence_relevance": {
          "accuracy": 100.0,
          "balanced_accuracy": 100.0,
          "constant_choice_baseline": 72.06349206349206,
          "attempts": 86,
          "invalid": 0,
          "critical_errors": 0,
          "brier": null,
          "probability_coverage": 0.0
        },
        "next_step": {
          "accuracy": 100.0,
          "balanced_accuracy": null,
          "constant_choice_baseline": 72.22222222222221,
          "attempts": 18,
          "invalid": 0,
          "critical_errors": 0,
          "brier": null,
          "probability_coverage": 0.0
        },
        "model_routing": {
          "accuracy": 100.0,
          "balanced_accuracy": 100.0,
          "constant_choice_baseline": 40.0,
          "attempts": 60,
          "invalid": 0,
          "critical_errors": 0,
          "brier": null,
          "probability_coverage": 0.0
        }
      }
    },
    {
      "model_id": "openai/gpt-6-astra",
      "resolved_models": [
        "openai/gpt-6-astra"
      ],
      "label": "OpenAI: GPT-6 Astra",
      "backend": "openrouter_chat",
      "provider": "openai/flex",
      "effort": "high",
      "repeats": 1,
      "cost_usd": 2.1638745,
      "cost_upper_bound_usd": 2.1638745,
      "mean_latency_seconds": 2.24727123771385,
      "categories": {
        "verdict": {
          "accuracy": 100.0,
          "balanced_accuracy": 100.0,
          "constant_choice_baseline": 72.22222222222221,
          "attempts": 18,
          "invalid": 0,
          "critical_errors": 0,
          "brier": null,
          "probability_coverage": 0.0
        },
        "hypothesis_update": {
          "accuracy": 100.0,
          "balanced_accuracy": 100.0,
          "constant_choice_baseline": 72.22222222222221,
          "attempts": 36,
          "invalid": 0,
          "critical_errors": 0,
          "brier": null,
          "probability_coverage": 0.0
        },
        "conclusion_check": {
          "accuracy": 100.0,
          "balanced_accuracy": 100.0,
          "constant_choice_baseline": 66.66666666666666,
          "attempts": 54,
          "invalid": 0,
          "critical_errors": 0,
          "brier": null,
          "probability_coverage": 0.0
        },
        "evidence_relevance": {
          "accuracy": 100.0,
          "balanced_accuracy": 100.0,
          "constant_choice_baseline": 72.06349206349206,
          "attempts": 86,
          "invalid": 0,
          "critical_errors": 0,
          "brier": null,
          "probability_coverage": 0.0
        },
        "next_step": {
          "accuracy": 100.0,
          "balanced_accuracy": null,
          "constant_choice_baseline": 72.22222222222221,
          "attempts": 18,
          "invalid": 0,
          "critical_errors": 0,
          "brier": null,
          "probability_coverage": 0.0
        },
        "model_routing": {
          "accuracy": 100.0,
          "balanced_accuracy": 100.0,
          "constant_choice_baseline": 40.0,
          "attempts": 60,
          "invalid": 0,
          "critical_errors": 0,
          "brier": null,
          "probability_coverage": 0.0
        }
      }
    },
    {
      "model_id": "anthropic/claude-opus-5.5",
      "resolved_models": [
        "anthropic/claude-opus-5.5"
      ],
      "label": "Anthropic: Claude Opus 5.5",
      "backend": "openrouter_chat",
      "provider": "anthropic",
      "effort": "high",
      "repeats": 1,
      "cost_usd": 3.003376,
      "cost_upper_bound_usd": 3.003376,
      "mean_latency_seconds": 4.629106554702637,
      "categories": {
        "verdict": {
          "accuracy": 27.77777777777778,
          "balanced_accuracy": 31.48148148148148,
          "constant_choice_baseline": 72.22222222222221,
          "attempts": 18,
          "invalid": 13,
          "critical_errors": 0,
          "brier": null,
          "probability_coverage": 0.0
        },
        "hypothesis_update": {
          "accuracy": 33.33333333333333,
          "balanced_accuracy": 31.01851851851852,
          "constant_choice_baseline": 72.22222222222221,
          "attempts": 36,
          "invalid": 24,
          "critical_errors": 0,
          "brier": null,
          "probability_coverage": 0.0
        },
        "conclusion_check": {
          "accuracy": 42.592592592592595,
          "balanced_accuracy": 38.88888888888889,
          "constant_choice_baseline": 66.66666666666666,
          "attempts": 54,
          "invalid": 31,
          "critical_errors": 0,
          "brier": null,
          "probability_coverage": 0.0
        },
        "evidence_relevance": {
          "accuracy": 31.746031746031743,
          "balanced_accuracy": 32.27272727272727,
          "constant_choice_baseline": 72.06349206349206,
          "attempts": 86,
          "invalid": 59,
          "critical_errors": 0,
          "brier": null,
          "probability_coverage": 0.0
        },
        "next_step": {
          "accuracy": 22.22222222222222,
          "balanced_accuracy": null,
          "constant_choice_baseline": 72.22222222222221,
          "attempts": 18,
          "invalid": 14,
          "critical_errors": 0,
          "brier": null,
          "probability_coverage": 0.0
        },
        "model_routing": {
          "accuracy": 30.0,
          "balanced_accuracy": 29.166666666666664,
          "constant_choice_baseline": 40.0,
          "attempts": 60,
          "invalid": 42,
          "critical_errors": 0,
          "brier": null,
          "probability_coverage": 0.0
        }
      }
    },
    {
      "model_id": "anthropic/claude-sonnet-5",
      "resolved_models": [
        "anthropic/claude-sonnet-5"
      ],
      "label": "Anthropic: Claude Sonnet 5",
      "backend": "openrouter_chat",
      "provider": "anthropic",
      "effort": "high",
      "repeats": 1,
      "cost_usd": 1.55841,
      "cost_upper_bound_usd": 1.55841,
      "mean_latency_seconds": 4.706424461736734,
      "categories": {
        "verdict": {
          "accuracy": 77.77777777777779,
          "balanced_accuracy": 90.74074074074075,
          "constant_choice_baseline": 72.22222222222221,
          "attempts": 18,
          "invalid": 2,
          "critical_errors": 2,
          "brier": null,
          "probability_coverage": 0.0
        },
        "hypothesis_update": {
          "accuracy": 61.11111111111111,
          "balanced_accuracy": 80.0925925925926,
          "constant_choice_baseline": 72.22222222222221,
          "attempts": 36,
          "invalid": 3,
          "critical_errors": 0,
          "brier": null,
          "probability_coverage": 0.0
        },
        "conclusion_check": {
          "accuracy": 72.22222222222221,
          "balanced_accuracy": 68.05555555555556,
          "constant_choice_baseline": 66.66666666666666,
          "attempts": 54,
          "invalid": 4,
          "critical_errors": 6,
          "brier": null,
          "probability_coverage": 0.0
        },
        "evidence_relevance": {
          "accuracy": 100.0,
          "balanced_accuracy": 100.0,
          "constant_choice_baseline": 72.06349206349206,
          "attempts": 86,
          "invalid": 0,
          "critical_errors": 0,
          "brier": null,
          "probability_coverage": 0.0
        },
        "next_step": {
          "accuracy": 61.11111111111111,
          "balanced_accuracy": null,
          "constant_choice_baseline": 72.22222222222221,
          "attempts": 18,
          "invalid": 5,
          "critical_errors": 2,
          "brier": null,
          "probability_coverage": 0.0
        },
        "model_routing": {
          "accuracy": 98.33333333333334,
          "balanced_accuracy": 97.91666666666666,
          "constant_choice_baseline": 40.0,
          "attempts": 60,
          "invalid": 1,
          "critical_errors": 0,
          "brier": null,
          "probability_coverage": 0.0
        }
      }
    }
  ],
  "release_hash": "0ab3d5225e33324d72c05dd4a1f4fad826a2cf2ed8564d94a80dfb7607dfbeae"
}
