| Reinforcement Learning problemlerini Markov Decision Process (MDP) çerçevesinde formüle eder; durum, eylem, ödül, politika ve değer fonksiyonlarını doğru tanımlar. |
2 |
3 |
|
|
|
|
|
|
|
|
|
|
|
|
|
| Bellman denklemlerini kullanarak değer fonksiyonları ve optimal politika ilişkisini açıklar; temel çözüm yaklaşımlarını (DP, MC, TD) karşılaştırır. |
2 |
3 |
|
|
|
|
|
|
|
|
|
|
|
|
|
| Tabular ortamlar için SARSA ve Q-Learning algoritmalarını uygular; keşif–sömürü dengesini uygun stratejilerle yönetir ve sonuçları yorumlar. |
2 |
3 |
|
|
|
|
|
|
|
|
|
|
|
|
|
| Fonksiyon yaklaşımı ve derin öğrenme temelli RL yöntemlerinin (DQN, policy gradient, actor–critic) temel mantığını açıklar; uygun senaryoda doğru yöntem ailesini seçer. |
2 |
3 |
|
|
|
|
|
|
|
|
|
|
|
|
|
| Seçilen bir RL probleminde deneysel çalışma yürütür: ortamı kurar, modeli eğitir, performansı öğrenme eğrileri ve temel metriklerle değerlendirir; bulgularını raporlayıp sunar. |
5 |
5 |
|
|
|
|
|
|
|
|
|
|
|
|
|