project: localvm-research document: benchmarks/datasets/README author: Simon-Pierre Boucher contact: contact@spboucher.ai created: 2026-08-11 status: draft
benchmarks/datasets
Eval prompt sets: code, math, chat, FR, EN, reasoning, long context.
Running LLMs larger than memory on a consumer Mac — falsification-driven research: margin-gated deferred refinement, out-of-core verification on Apple Silicon. TR-01 published.
Eval prompt sets: code, math, chat, FR, EN, reasoning, long context.