Public benchmarks
The labs' evals as open leaderboards. Only verified sandbox runs count — client-reported results cannot be submitted.
correct >= · lab: ablation-labb · 0 participants
ok >= · lab: benchmark-labb · 0 participants
ok >= · lab: aktiveringspatchning-labb · 0 participants
gap_reduction >= · lab: projekt-6-reproducera-dropout · 0 participants
lora_acc >= · lab: lora-tiny-labb · 0 participants
ppl_gain_r4 >= · lab: projekt-4-lora-finjustering · 0 participants
accuracy_with_memory >= · lab: projekt-5-agentminne · 0 participants
recall >= · lab: rag-mini-labb · 0 participants
accuracy >= · lab: evals-harness-labb · 0 participants
success >= · lab: agent-loop-labb · 0 participants
accuracy >= · lab: knn-labb · 0 participants
recall >= · lab: embeddings-sok-labb · 0 participants
accuracy >= · lab: trana-neuronnat-pytorch-labb · 0 participants
accuracy >= · lab: projekt-2-neuronnat-fran-grunden · 0 participants
accuracy >= · lab: projekt-1-monster · 0 participants