|
…
|
|
forge-tiny-25m-smoke.json
|
chore: commit pending workspace changes
|
yesterday |
|
gpt-100m.json
|
Forge: LLM training from scratch in C++20 + Metal on Apple Silicon
|
10 days ago |
|
gpt-10m-1epoch.json
|
Forge: LLM training from scratch in C++20 + Metal on Apple Silicon
|
10 days ago |
|
gpt-10m.json
|
Forge: LLM training from scratch in C++20 + Metal on Apple Silicon
|
10 days ago |
|
gpt-200m-cluster.json
|
200M cluster run: one epoch at micro-batch 8
|
10 days ago |
|
gpt-200m.json
|
Forge: LLM training from scratch in C++20 + Metal on Apple Silicon
|
10 days ago |
|
gpt-25m.json
|
Forge: LLM training from scratch in C++20 + Metal on Apple Silicon
|
10 days ago |
|
gpt-50m-deep.json
|
Add configurable training modes: Muon optimizer and WSD schedule
|
5 days ago |
|
gpt-50m-gemma.json
|
Add architecture-variant waves 1+2: train...
|
5 days ago |
|
gpt-50m-mistral.json
|
Add architecture-variant waves 1+2: train...
|
5 days ago |
|
gpt-50m-moe.json
|
Add QAT, MoE, and architecture-variant knobs — all config-selected
|
5 days ago |
|
gpt-50m-muon.json
|
Add configurable training modes: Muon optimizer and WSD schedule
|
5 days ago |
|
gpt-50m-ternary.json
|
Add QAT, MoE, and architecture-variant knobs — all config-selected
|
5 days ago |
|
gpt-50m.json
|
Add configurable training modes: Muon optimizer and WSD schedule
|
5 days ago |
|
gpt-smoke.json
|
Forge: LLM training from scratch in C++20 + Metal on Apple Silicon
|
10 days ago |
|
richard-10m-1epoch.json
|
chore: commit pending workspace changes
|
yesterday |