summaryrefslogtreecommitdiff
path: root/tests/test_eval_classification.py
AgeCommit message (Collapse)Author
13 daysfix(eval): P5/P6 sieve-rank ladder replaces hardcoded FLAGGED_SIEVE_PREDSVoid Agent
- probe_report: dynamic lo/hi (no more hardcoded [101,200]) - main(): probe range derived from range_end ([range_end+1, range_end+1000]) - P6 = exact (no probe misses), P5(k) = errors match rank-k sieve signature - _sieve_rank_signature: computes composites with all factors > p_k - _compute_sieve_rank: identifies rank from model's error predictions - build_report.py: probe_fig uses sieve rank for coloring - Tests updated for P5/P6 codes (48/48 green)
2026-08-15speedup: batched eval (46x, sieve-stub verified), run_sweep orchestrator ↵Void Agent
(2-way parallel, idempotent, summaries), E1 jobs; 36 tests
2026-08-14eval: P1 diagnostic prediction-based (flagged set +209), classifier ↵Void Agent
regression suite (10 tests, stub ground truth); 34 tests green