spb/localvm-research Public License
Running LLMs larger than memory on a consumer Mac — falsification-driven research: margin-gated deferred refinement, out-of-core verification on Apple Silicon. TR-01 published.
Python 63.2%
JavaScript 23.5%
CSS 11.8%
Shell 0.9%
Makefile 0.5%
1resident q4: 0.97 GB · streamed q8: 1.83 GB2baseline: pure q8 greedy …3baseline: pure q4 greedy …4runtime: mode=margin tau=1.0 W=32 …5 fidelity=0.5518 tok/s=99.6 defer=0.38 rollback=0.067 MB/token(logical)=1546runtime: mode=margin tau=2.0 W=32 …7 fidelity=0.6484 tok/s=71.2 defer=1.00 rollback=0.106 MB/token(logical)=2168runtime: mode=verify-all tau=2.0 W=32 …9 fidelity=0.8825 tok/s=63.6 defer=1.04 rollback=0.117 MB/token(logical)=2311011wrote /Users/simon-pierreboucher/Desktop/localvm-research/results/candidate_01/20260812T051501Z/results.json12baselines: {13 "pure_q4": {14 "tokens_per_s": 287.5061867410425,15 "fidelity_vs_q8_mean": 0.48632812516 },17 "pure_q8": {18 "tokens_per_s": 200.05224940165664,19 "fidelity_vs_q8_mean": 1.020 }21}22