Hoppa till innehållet
AI-grafen

Träna en agent med belöning

Från banditer till policy gradient: bygg en miljö, låt en agent lära sig av belöning, och förstå varför RL är svårt.

E· Universitet