| Ders Adı | REINFORCEMENT LEARNING | Kod | CMPE9299 |
| Kredi | 3 | AKTS | 8 |
| Z/S | Seçmeli | Teorik Saat | 3 |
| Uygulama Saat | 0 | Lab Saat | 0 |
| Ders Dili | İngilizce | Dersi Veren | Doç. Dr. FATMA ÖNAY KOÇOĞLU |
| Dersin Veriliş Türü | Örgün | ||
Bu dersin amacı, öğrencilerin pekiştirmeli öğrenmenin (Reinforcement Learning) temel kavramlarını ve matematiksel çerçevesini (MDP, değer fonksiyonları, Bellman denklemleri) kavramalarını; model-free yöntemlerden (Monte Carlo, TD, SARSA, Q-learning) derin pekiştirmeli öğrenmeye (DQN, policy gradient, actor–critic) uzanan ana algoritma ailelerini öğrenmelerini; keşif–sömürü dengesi, kararlılık ve örnek verimliliği gibi pratik zorlukları analiz edebilmelerini ve seçilen bir problem üzerinde uygun bir RL yaklaşımını tasarlayıp uygulayarak deneysel olarak değerlendirebilmelerini sağlamaktır.
Bu ders, pekiştirmeli öğrenmenin temel prensiplerini ve modern yöntemlerini doktora düzeyinde ele alır. Markov Karar Süreçleri, değer fonksiyonları ve Bellman denklemleri üzerine kurulan teorik çerçeve; dinamik programlama, Monte Carlo ve temporal-difference yaklaşımlarıyla pekiştirilir. Devamında SARSA ve Q-learning gibi model-free kontrol yöntemleri, keşif–sömürü dengesi ve fonksiyon yaklaşımı incelenir. Dersin ikinci bölümünde policy gradient ve actor–critic ailesi ile Deep Q-Network (DQN) gibi derin pekiştirmeli öğrenme yöntemleri tanıtılır; sürekli kontrol için temel yaklaşımlar ve seçmeli ileri konular (ör. offline RL, imitation learning, multi-agent RL, RLHF) tartışılır. Öğrenciler dönem projesi kapsamında bir RL problemini uçtan uca modelleyip deneysel olarak değerlendirir.
Anlatım (kuramsal ders), etkileşimli sınıf tartışmaları ve soru–cevap, okuma görevlendirmeleri (temel kaynak + seçilmiş makaleler) ve okuma özeti sunumları, dönem projesi: proje önerisi, ara rapor, nihai rapor ve sunum
Sutton & Barto — Reinforcement Learning: An Introduction, MIT Press Puterman — Markov Decision Processes: Discrete Stochastic Dynamic Programming, John Wiley & Sons, Inc Szepesvári — Algorithms for Reinforcement Learning, Springer