self-improve-forecasterworkflow0
raghavrajsah/glassbox
What it does

Improve forecast accuracy iteratively

Best for

Improving a forecasting playbook on a domain-specific dataset without web research (airgapped)

Inputs
  • · train dataset: [{ id, question, strike, category, is_deadline, direction, ladder_rung, trivial_bound, outcome }]
  • · holdout dataset: same structure, outcome hidden
  • · gen1_playbook_md: initial forecasting doctrine
  • · generations: N rounds of improve cycle
Outputs
  • · generational playbooks (improved after each round)
  • · train Brier score per generation
  • · calibration analysis per forecast type
  • · systematic errors identified and addressed
  • · holdout Brier score (final test)
Requires
  • · agent forecaster (per generation, consumes playbook)
  • · verifier agent (scores against train, computes Brier + calibration)
  • · diagnostician agent (identifies systematic errors, rewrites playbook)
  • · deterministic Brier scoring (authoritative, leak-proof)
Preconditions
  • · train/holdout data split clean (outcome NEVER shown to forecaster)
  • · base playbook in markdown format
  • · Brier scoring deterministic (no RNG)
Failure modes
  • · train data leaks outcome to forecaster (taints all rounds)
  • · calibration overfits to train (holdout performance drops)
  • · playbook converges to local optimum (no further improvement)
  • · systematic error diagnosis misses root cause
Trust signals
  • · Train/holdout split enforced; outcome hidden from forecaster
  • · 3 schemas: FORECAST_SCHEMA, VERIFIER_SCHEMA, DIAG_SCHEMA
  • · Deterministic Brier scoring (authoritative gate)
  • · Calibration analysis per forecast type (bin-by-ladder-rung, etc.)
  • · N generations configurable; measured on held-out set
  • · No web research (airgapped, leak-proof)