Kursplan
1. Introduktion till djupberökningsinlärning
- Vad är förstärkningsinlärning?
- Skillnaden mellan övervakad, oövervakad och förstärkningsinlärning
- Tillämpningar av DRL 2025 (robotik, hälsovård, finans, logistik)
- Förstå loop för agenty-miljöinteraktion
2. Grundläggande förstärkningsinlärning
- Markoviska beslutsprocesser (MDP)
- Tillstånd, action, belöning, policy och värdiefunktioner
- Trade-off mellan utforskning och utnyttjande
- Monte Carlo-metoder och Temporal-Difference (TD)-inlärning
3. Implementering av grundläggande RL-algoritmer
- Tabellmetoder: Dynamisk programmering, polisybedomning och iteration
- Q-Learning och SARSA
- Epsilon-greedy utforskning och uttunningsstrategier
- Implementering av RL-miljöer med OpenAI Gymnasium
4. Övergång till djupberökningsinlärning
- Begränsningarna med tabellmetoder
- Användning av neurala nätverk för funktionapproximation
- Deep Q-Network (DQN)-arkitektur och arbetsflöde
- Experience replay och målnätverk
5. Avancerade DRL-algoritmer
- Double DQN, Dueling DQN och Prioritized Experience Replay
- Policy Gradient-metoder: REINFORCE-algoritm
- Actor-Critic-arkitekturer (A2C, A3C)
- Proximal Policy Optimization (PPO)
- Soft Actor-Critic (SAC)
6. Arbete med kontinuerliga actionsutrymen
- Utmaningar inom kontinuerlig styrning
- Användning av DDPG (Deep Deterministic Policy Gradient)
- Twin Delayed DDPG (TD3)
7. Praktiska verktyg och ramverk
- Användning av Stable-Baselines3 och Ray RLlib
- Loggning och övervakning med TensorBoard
- Hyperparameterjustering för DRL-modeller
8. Belöningsingenjörskonst och miljödesign
- Belöningsformning och balansering av straff
- Begrepp kring överföringsinlärning från simulering till verklighet
- Skapande av anpassade miljöer i Gymnasium
9. Delvis observerbara miljöer och generalisering
- Hantering av ofullständig tillstånds information (POMDP)
- Minnesbaserade metoder med hjälp av LSTM och RNN
- Förbättring av agentyns robusthet och generaliseringsförmåga
10. Spelteori och Multi-Agent Reinforcement Learning
- Introduktion till multi-agenty-miljöer
- Samarbete kontra konkurrens
- Tillämpningar inom adversarial träning och strategisoptimering
11. Fallstudier och tillämpningar i verkligheten
- Simuleringar av självkörande fordon
- Dynamisk prissättning och finansiella handelsstrategier
- Robotik och industriell automation
12. Felsökning och optimering
- Diagnostik av instabil träning
- Hantering av sparsam belöning och överanpassning
- Skalning av DRL-modeller på GPU och distribuerade system
13. Sammanfattning och nästa steg
- Genomgång av DRL-arkitektur och viktiga algoritmer
- Trender i branschen och forskningsriktningar (t.ex. RLHF, hybridmodeller)
- Ytterligare resurser och läslitteratur
Krav
- Goda kunskaper i Python-programmering
- Förståelse för kalkyl och linjär algebra
- Grundläggande kunskaper i sannolikhetslära och statistik
- Erfarenhet av att bygga maskininlärningsmodeller med Python och NumPy eller TensorFlow/PyTorch
Målgrupp
- Utvecklare med intresse för AI och intelligenta system
- Datavetare som utforskar ramverk för förstärkningsinlärning
- Maskininlärningstekniker som arbetar med autonoma system
Vittnesmål (2)
Att hjälpa dem som aldrig har använt AI att uppnå bättre precision genom upprepade anpassningar av prompts, samt uppmuntra erfarna användare att utforska olika strategier för att använda tekniken.
Matthew Gay - Tarsus Pharmaceuticals
Kurs - Artificial Intelligence (AI) Overview
Maskintolkat
Att arbeta från grunderna på ett fokuserat sätt och övergå till att tillämpa fallstudier samma dag
Maggie Webb - Department of Jobs, Regions, and Precincts
Kurs - Artificial Neural Networks, Machine Learning, Deep Thinking
Maskintolkat