Bas- kontra instruktionsmodeller
Kunna förklara skillnaden mellan förtränad bas och instruktionsjusterad modell och chat-mallar.
Förkunskaper
Intuition
Basmodellen är förtränad på att förutsäga nästa token i webbtext. Ger du den «Vad är huvudstaden i Sverige?» kan den svara med ett svar — eller med fler frågor, för så ser texter med frågor ofta ut.
Instruktionsmodellen har därefter tränats i två steg:
- SFT på (instruktion, bra svar)-par → den lär sig att svara.
- Preferensträning (RLHF eller DPO) på par där människor rangordnat två svar → den lär sig vilken sorts svar som föredras: hjälpsamt, tryggt, välformaterat.
Basmodeller används till vidareträning och forskning. Till allt annat väljer du instruktionsvarianten (-instruct, -chat).
Kod
from transformers import AutoTokenizer
tok = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-7B-Instruct")
msgs = [{"role": "system", "content": "Du är en hjälpsam handledare."},
{"role": "user", "content": "Vad är en gradient?"}]
prompt = tok.apply_chat_template(msgs, tokenize=False, add_generation_prompt=True)
print(prompt)
# <|im_start|>system
# Du är en hjälpsam handledare.<|im_end|>
# <|im_start|>user
# Vad är en gradient?<|im_end|>
# <|im_start|>assistant
Chat-mallen är inte kosmetik. Varje modellfamilj har sin egen (ChatML, Llama-3, Mistral …), och modellen är tränad på exakt de specialtokens. Använder du fel mall — eller ingen alls — tappar modellen mätbart i kvalitet och kan börja skriva användarens repliker åt dig. Använd alltid apply_chat_template i stället för att bygga strängen själv.
Bieffekter av preferensträning att känna till: modeller blir mer utförliga än nödvändigt (längd korrelerar med preferens i träningsdatan), mer medhållande (sycophancy — håller med användaren även när användaren har fel), och ibland onödigt försiktiga. Det är avvägningar som gjorts, inte buggar.
Behärskning innebär
- Skiljer basmodell från instruktionsmodell
- Använder rätt chat-mall
- Vet vad RLHF/DPO tillför
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- arXiv — Training language models to follow instructions with human feedback — arXiv (öppen åtkomst; licens per artikel)
- arXiv — Direct Preference Optimization — arXiv (öppen åtkomst; licens per artikel)
- Hugging Face — dokumentation (Apache-2.0) — Apache-2.0