summaryrefslogtreecommitdiff
path: root/config_dryrun.yaml
diff options
context:
space:
mode:
authorCaptainJack2491 <jayrupnakawala@gmail.com>2026-04-15 21:18:57 +0100
committerCaptainJack2491 <jayrupnakawala@gmail.com>2026-04-15 21:18:57 +0100
commit6cc92304379996f68bb2df96a5e4b637b4c4804b (patch)
tree6cdbc8b5484934927cd6ac989e91fef44a60bb4c /config_dryrun.yaml
parentd25f8fc2e2b02c04489ca1960b83ff7a70e7317a (diff)
Study 1: 270 runs complete + judge validation pipeline
- config_study1.yaml: 3 models × 3 oversight × bare framing × n=30 - Judge validation: 54-run subset, gold=Sonnet 4.6, proxy=Grok 4.1 Fast (BB κ=0.702) + GPT-4.1 (GB κ=0.878) - Fix OpenAI batch provider: BytesIO, method/url fields, response.body parsing - Scripts: extract_subset.py, judge_validation.py - Dissertation chapters updated (intro, methodology, results, conclusion)
Diffstat (limited to 'config_dryrun.yaml')
-rw-r--r--config_dryrun.yaml10
1 files changed, 6 insertions, 4 deletions
diff --git a/config_dryrun.yaml b/config_dryrun.yaml
index cd362ba..29ac69a 100644
--- a/config_dryrun.yaml
+++ b/config_dryrun.yaml
@@ -14,7 +14,7 @@ models:
reasoning:
effort: "high"
exclude: false
- - id: z-ai/glm-5
+ - id: z-ai/glm-5.1
provider: openrouter
extra_body:
reasoning:
@@ -38,19 +38,21 @@ scenarios:
oversight_levels:
- high
+ - med
+ - low
execution:
max_workers: 10
output:
- dir: logs/v2_dry_run
+ dir: logs/testing_judge
save_vfs_state: true
logging:
- level: 4
+ level: 3
format: "[{level}] {message}"
output: both
- file: logs/dry_run.log
+ file: logs/testing_judge/exeriments.log
judge:
log_dir: logs/judge_dryrun