E· Universitetai-produktutveckling· ca 60 min· utvecklande· verifierad 2026-09-20
Promptar som kod: versionering och test
Kunna versionera promptar, testa dem i CI och mäta regressioner.
Förkunskaper
Intuition
En prompt i produktion är kod. Den bestämmer systemets beteende, den går sönder, och den måste därför behandlas därefter:
| Kod | Prompt |
|---|---|
| i git | i git — inte i en databas eller ett Google-dokument |
| versionerad | versionerad, med id i loggarna |
| testad i CI | evalsvit i CI med tröskel |
| kodgranskad | granskad av någon annan |
| rullas tillbaka | går att rulla tillbaka på minuter |
Den vanligaste felkällan i LLM-produkter är att någon «bara ändrade en formulering» i en prompt, allt blev sämre, och ingen kunde säga när eller varför.
Kod
prompts/
├── tutor_explain/
│ ├── v3.md # aktuell
│ ├── v2.md
│ └── cases.jsonl # evalfall som hör till just den här prompten
└── registry.yaml # vilken version som är aktiv per miljö
from pathlib import Path
import hashlib, yaml
REG = yaml.safe_load(Path("prompts/registry.yaml").read_text())
def hamta_prompt(namn: str, miljo: str = "prod") -> tuple[str, str]:
version = REG[namn][miljo] # t.ex. "v3"
text = Path(f"prompts/{namn}/{version}.md").read_text(encoding="utf-8")
return text, f"{namn}:{version}:{hashlib.sha256(text.encode()).hexdigest()[:8]}"
prompt, prompt_id = hamta_prompt("tutor_explain")
# logga prompt_id med varje anrop → går att spåra vilket beteende ett svar kom ur
# .github/workflows/ci.yml (eller scripts/ci.sh)
- run: python -m evals.run --prompts prompts/ --threshold 0.85 --fail-on-regression
Tre regler som räcker långt: prompt-id i varje loggrad, evalsviten körs på varje ändring av en promptfil, och varje ny promptversion jämförs mot den aktiva — inte bara mot tröskeln. En prompt som klarar tröskeln men tappar tre tidigare godkända fall är en regression.
Behärskning innebär
- Versionerar promptar som kod
- Testar promptar i CI mot en fallmängd
- Mäter regressioner mellan promptversioner
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- OpenAI Evals (MIT) — MIT
- Anthropic — Prompt engineering — dokumentation, fri läsning