REINFORCEMENT LEARNING

İzlence Formu

Ders Adı REINFORCEMENT LEARNING Kod CMPE9299
Kredi 3 AKTS 8
Z/S Seçmeli Teorik Saat 3
Uygulama Saat 0 Lab Saat 0
Ders Dili İngilizce Dersi Veren Doç. Dr. FATMA ÖNAY KOÇOĞLU
Dersin Veriliş Türü Örgün

Dersin Amacı

Bu dersin amacı, öğrencilerin pekiştirmeli öğrenmenin (Reinforcement Learning) temel kavramlarını ve matematiksel çerçevesini (MDP, değer fonksiyonları, Bellman denklemleri) kavramalarını; model-free yöntemlerden (Monte Carlo, TD, SARSA, Q-learning) derin pekiştirmeli öğrenmeye (DQN, policy gradient, actor–critic) uzanan ana algoritma ailelerini öğrenmelerini; keşif–sömürü dengesi, kararlılık ve örnek verimliliği gibi pratik zorlukları analiz edebilmelerini ve seçilen bir problem üzerinde uygun bir RL yaklaşımını tasarlayıp uygulayarak deneysel olarak değerlendirebilmelerini sağlamaktır.

İçerik

Bu ders, pekiştirmeli öğrenmenin temel prensiplerini ve modern yöntemlerini doktora düzeyinde ele alır. Markov Karar Süreçleri, değer fonksiyonları ve Bellman denklemleri üzerine kurulan teorik çerçeve; dinamik programlama, Monte Carlo ve temporal-difference yaklaşımlarıyla pekiştirilir. Devamında SARSA ve Q-learning gibi model-free kontrol yöntemleri, keşif–sömürü dengesi ve fonksiyon yaklaşımı incelenir. Dersin ikinci bölümünde policy gradient ve actor–critic ailesi ile Deep Q-Network (DQN) gibi derin pekiştirmeli öğrenme yöntemleri tanıtılır; sürekli kontrol için temel yaklaşımlar ve seçmeli ileri konular (ör. offline RL, imitation learning, multi-agent RL, RLHF) tartışılır. Öğrenciler dönem projesi kapsamında bir RL problemini uçtan uca modelleyip deneysel olarak değerlendirir.

Öğretim Yöntemleri

Anlatım (kuramsal ders), etkileşimli sınıf tartışmaları ve soru–cevap, okuma görevlendirmeleri (temel kaynak + seçilmiş makaleler) ve okuma özeti sunumları, dönem projesi: proje önerisi, ara rapor, nihai rapor ve sunum

Kaynaklar

Sutton & Barto — Reinforcement Learning: An Introduction, MIT Press Puterman — Markov Decision Processes: Discrete Stochastic Dynamic Programming, John Wiley & Sons, Inc Szepesvári — Algorithms for Reinforcement Learning, Springer

Bilgi İşlem Daire Başkanlığı © 2026