diff options
| author | CaptainJack2491 <jayrupnakawala@gmail.com> | 2026-04-15 21:18:57 +0100 |
|---|---|---|
| committer | CaptainJack2491 <jayrupnakawala@gmail.com> | 2026-04-15 21:18:57 +0100 |
| commit | 6cc92304379996f68bb2df96a5e4b637b4c4804b (patch) | |
| tree | 6cdbc8b5484934927cd6ac989e91fef44a60bb4c /config_dryrun.yaml | |
| parent | d25f8fc2e2b02c04489ca1960b83ff7a70e7317a (diff) | |
Study 1: 270 runs complete + judge validation pipeline
- config_study1.yaml: 3 models × 3 oversight × bare framing × n=30
- Judge validation: 54-run subset, gold=Sonnet 4.6, proxy=Grok 4.1 Fast (BB κ=0.702) + GPT-4.1 (GB κ=0.878)
- Fix OpenAI batch provider: BytesIO, method/url fields, response.body parsing
- Scripts: extract_subset.py, judge_validation.py
- Dissertation chapters updated (intro, methodology, results, conclusion)
Diffstat (limited to 'config_dryrun.yaml')
| -rw-r--r-- | config_dryrun.yaml | 10 |
1 files changed, 6 insertions, 4 deletions
diff --git a/config_dryrun.yaml b/config_dryrun.yaml index cd362ba..29ac69a 100644 --- a/config_dryrun.yaml +++ b/config_dryrun.yaml @@ -14,7 +14,7 @@ models: reasoning: effort: "high" exclude: false - - id: z-ai/glm-5 + - id: z-ai/glm-5.1 provider: openrouter extra_body: reasoning: @@ -38,19 +38,21 @@ scenarios: oversight_levels: - high + - med + - low execution: max_workers: 10 output: - dir: logs/v2_dry_run + dir: logs/testing_judge save_vfs_state: true logging: - level: 4 + level: 3 format: "[{level}] {message}" output: both - file: logs/dry_run.log + file: logs/testing_judge/exeriments.log judge: log_dir: logs/judge_dryrun |
