Kom i kontakt
 Varaktighet 21 timmar

Kursplan

1. Introduktion till djupberökningsinlärning

  • Vad är förstärkningsinlärning?
  • Skillnaden mellan övervakad, oövervakad och förstärkningsinlärning
  • Tillämpningar av DRL 2025 (robotik, hälsovård, finans, logistik)
  • Förstå loop för agenty-miljöinteraktion

2. Grundläggande förstärkningsinlärning

  • Markoviska beslutsprocesser (MDP)
  • Tillstånd, action, belöning, policy och värdiefunktioner
  • Trade-off mellan utforskning och utnyttjande
  • Monte Carlo-metoder och Temporal-Difference (TD)-inlärning

3. Implementering av grundläggande RL-algoritmer

  • Tabellmetoder: Dynamisk programmering, polisybedomning och iteration
  • Q-Learning och SARSA
  • Epsilon-greedy utforskning och uttunningsstrategier
  • Implementering av RL-miljöer med OpenAI Gymnasium

4. Övergång till djupberökningsinlärning

  • Begränsningarna med tabellmetoder
  • Användning av neurala nätverk för funktionapproximation
  • Deep Q-Network (DQN)-arkitektur och arbetsflöde
  • Experience replay och målnätverk

5. Avancerade DRL-algoritmer

  • Double DQN, Dueling DQN och Prioritized Experience Replay
  • Policy Gradient-metoder: REINFORCE-algoritm
  • Actor-Critic-arkitekturer (A2C, A3C)
  • Proximal Policy Optimization (PPO)
  • Soft Actor-Critic (SAC)

6. Arbete med kontinuerliga actionsutrymen

  • Utmaningar inom kontinuerlig styrning
  • Användning av DDPG (Deep Deterministic Policy Gradient)
  • Twin Delayed DDPG (TD3)

7. Praktiska verktyg och ramverk

  • Användning av Stable-Baselines3 och Ray RLlib
  • Loggning och övervakning med TensorBoard
  • Hyperparameterjustering för DRL-modeller

8. Belöningsingenjörskonst och miljödesign

  • Belöningsformning och balansering av straff
  • Begrepp kring överföringsinlärning från simulering till verklighet
  • Skapande av anpassade miljöer i Gymnasium

9. Delvis observerbara miljöer och generalisering

  • Hantering av ofullständig tillstånds information (POMDP)
  • Minnesbaserade metoder med hjälp av LSTM och RNN
  • Förbättring av agentyns robusthet och generaliseringsförmåga

10. Spelteori och Multi-Agent Reinforcement Learning

  • Introduktion till multi-agenty-miljöer
  • Samarbete kontra konkurrens
  • Tillämpningar inom adversarial träning och strategisoptimering

11. Fallstudier och tillämpningar i verkligheten

  • Simuleringar av självkörande fordon
  • Dynamisk prissättning och finansiella handelsstrategier
  • Robotik och industriell automation

12. Felsökning och optimering

  • Diagnostik av instabil träning
  • Hantering av sparsam belöning och överanpassning
  • Skalning av DRL-modeller på GPU och distribuerade system

13. Sammanfattning och nästa steg

  • Genomgång av DRL-arkitektur och viktiga algoritmer
  • Trender i branschen och forskningsriktningar (t.ex. RLHF, hybridmodeller)
  • Ytterligare resurser och läslitteratur

Krav

  • Goda kunskaper i Python-programmering
  • Förståelse för kalkyl och linjär algebra
  • Grundläggande kunskaper i sannolikhetslära och statistik
  • Erfarenhet av att bygga maskininlärningsmodeller med Python och NumPy eller TensorFlow/PyTorch

Målgrupp

  • Utvecklare med intresse för AI och intelligenta system
  • Datavetare som utforskar ramverk för förstärkningsinlärning
  • Maskininlärningstekniker som arbetar med autonoma system

Antal deltagare


Pris per deltagare

Vittnesmål (2)

Kommande Kurser

Relaterade Kategorier