Statistical & Visual Analysis

Multi-Stage Judging

Data Persistence

Experiment Orchestration

Input & Configuration

Judging Metrics

Environment Sandbox

config.yaml

ConfigLoader

Scenarios Database

Oversight Levels: low/mid/high

ExperimentRunner

Agent Logic

Virtual File System

Scenario Data Files

LLM Provider API

Interaction Logs .json

Judge Engine

Regex Checks

Blackbox LLM Judge: Output Accuracy

Glassbox LLM Judge: Reasoning Intent

Consolidated Results .csv

Statistical Analysis Engine

p-values, Odds Ratios, effect sizes

Visualization Module

Charts & Heatmaps