From 66f99ee30087a5f28ad852e581a0334c7f556091 Mon Sep 17 00:00:00 2001 From: Void Agent Date: Wed, 29 Jul 2026 17:42:47 +0100 Subject: Initial project setup: J-lens implementation for nanoGPT - Core J-lens computation (batched per-layer, per-token gradient method) - Project README with background and experiment plan - Sync script for meru Docker container deployment - Upstream nanoGPT model code copied to src/ Architecture: Computes d(log_p(token))/d(residual_stream) averaged over corpus contexts, replicating Anthropic's Jacobian Lens technique. --- src/eval_gpt2_large.py | 8 ++++++++ 1 file changed, 8 insertions(+) create mode 100644 src/eval_gpt2_large.py (limited to 'src/eval_gpt2_large.py') diff --git a/src/eval_gpt2_large.py b/src/eval_gpt2_large.py new file mode 100644 index 0000000..4cbeaef --- /dev/null +++ b/src/eval_gpt2_large.py @@ -0,0 +1,8 @@ +# evaluate the base gpt2 +# n_layer=36, n_head=20, n_embd=1280 +# 774M parameters +batch_size = 8 +eval_iters = 500 # use more iterations to get good estimate +eval_only = True +wandb_log = False +init_from = 'gpt2-large' -- cgit v1.2.3