Projekt: bygg en AI-tjänst end-to-end
Kunna leverera en fungerande AI-tjänst med retrieval, evals, kvoter och observability.
Förkunskaper
Intuition
Projektet: en fungerande AI-tjänst som någon annan kan köra och lita på. Förslag: en frågetjänst över ett dokumentmaterial du har rätt att använda.
Leverabler:
| Del | Krav |
|---|---|
| Retrieval | chunkning motiverad, hybrid eller vektor, recall@10 mätt på ≥ 40 verkliga frågor |
| Generering | grundning med citat, «vet inte»-beteende, strukturerat svar |
| API | validering, /healthz, felkoder, timeout, kvot per användare |
| Degradering | definierat läge när LLM eller vektordb är nere — och testat |
| Evals | ≥ 30 fall i CI med tröskel och regressionslista |
| Observability | strukturerad logg, latens p95, kostnad per anrop, andel fallback |
| Dokumentation | README, arkitekturskiss, begränsningar, körkostnad |
Det som skiljer godkänt från starkt är de sista tre raderna — de flesta bygger retrieval och API och stannar där.
Interaktivt
Bedömningsmatris — använd den på dig själv:
| Del | Godkänt | Starkt |
|---|---|---|
| Retrieval | fungerar | recall mätt, chunkstrategi jämförd mot alternativ |
| Grundning | citat finns | grundningsgrad mätt med domare, «vet inte» fungerar |
| API | svarar | kvoter, 503-degradering testad i CI |
| Evals | finns | blockerar merge, regressionslista granskas |
| Observability | loggar | p95, kostnad/anrop och driftlarm |
| Rapport | beskriver | siffror med osäkerhet och ärliga begränsningar |
Vanligaste bristerna, i ordning: degraderingen finns i koden men har aldrig körts; evalsviten är skriven men körs inte i CI; kostnaden per anrop är okänd; och testfrågorna är påhittade av den som byggde systemet.
Tidsplan (ca 5 timmar aktiv tid, utspritt): 1 h data och chunkning · 1 h retrieval och mätning · 1 h API och degradering · 1 h evals i CI · 1 h observability och rapport.
Behärskning innebär
- Levererar en körande AI-tjänst med retrieval och evals
- Har kvoter, degraderat läge och observability
- Redovisar mätningar och begränsningar ärligt
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- FastAPI — dokumentation (MIT) — MIT
- arXiv — RAGAS: Automated Evaluation of RAG — arXiv (öppen åtkomst; licens per artikel)
- Google — Rules of Machine Learning — CC BY 4.0