Statistical & Visual Analysis
Multi-Stage Judging
Data Persistence
Experiment Orchestration
Input & Configuration
Judging Metrics
Environment Sandbox
config.yaml
ConfigLoader
Scenarios Database
Oversight Levels: low/mid/high
ExperimentRunner
Agent Logic
Virtual File System
Scenario Data Files
LLM Provider API
Interaction Logs .json
Judge Engine
Regex Checks
Blackbox LLM Judge: Output Accuracy
Glassbox LLM Judge: Reasoning Intent
Consolidated Results .csv
Statistical Analysis Engine
p-values, Odds Ratios, effect sizes
Visualization Module
Charts & Heatmaps