Shake AI Lab
Home
Blog
実装で学ぶ
用語辞典
ギャラリー
はじめての方へ
About
検索
← タグ一覧に戻る
「強化学習」の記事一覧
Q学習で迷路を解いたら、報酬が出口から逆向きに染みてきた。そして崖っぷちを攻めるQ学習と、遠回りするSARSA
Jul 21, 2026
実践記
強化学習
ε-greedyの後悔は直線で伸び続けた。UCBとThompson samplingを競走させたら395対185対79
Jul 21, 2026
実践記
強化学習
「たまには冒険したほうがいい」を多腕バンディットで測ったら、最適な選択を引けた割合が35.95%から79.31%まで変わった
Jul 16, 2026
実践記
強化学習