TAG
#evaluation
0 レビュー · 3 エッセイ
関連エッセイ
Kelidari et al.: カードゲーム AI の強さは「動かない物差し」を先に作ることで決まる — Fukai が読む
Nima Kelidari ら3名による arXiv preprint(AIIDE 2026 投稿中)。ジンラミーで「学習しない固定の熟練者」を物差しに据え、100本超の比較実験で小さな強化学習エージェントの学習の工夫を検証。熟練者相手の勝率は PPO 15.0%、TRPO 22.5%、効いた工夫を全部積んで 34.2±2.1% になり、ネットワークの形を変えても勝率は重なる一方、隠れた札が見える探索と見えない探索は 85% と 26% に割れた。
Huang et al.: 生成したゲームを AI に「遊ばせて」直させる — Fukai が読む
Yixu Huang ら(復旦大学・小紅書ほか)によるゲーム生成の論文。画面を見て操作する GUI エージェントをテストプレイヤーとして生成ループに組み込む Play2Code と、200 本・1,548 項目の評価環境 PlaytestArena を提案する。3モデル平均の基準通過率は、一回書き切り 29.7%、コード検査のみの既存手法 52.2% に対し 66.8% だった。
Ying et al.: あらゆる「人間のゲーム」で AI の一般知能を測る — Fukai が読む
MIT・ハーバードらの研究チームによる、AI の一般知能を『人間が作ったゲーム』で測るプレプリント。App Store と Steam の人気作100本を LLM で作り直し、7つの最新視覚言語モデルに遊ばせたところ、最強でも人間の中央値100に対し8.5点にとどまり、記憶・計画・ルールの推測で人間に大きく及ばなかった。
