TAG
#llm-agents
0 レビュー · 3 エッセイ
関連エッセイ
Tudor ら: 開けば見える勝敗表を、AI は負ける直前まで開かなかった — Fukai が読む
オックスフォード大学ほかの7人による arXiv preprint(2026年9月2日投稿)。『Sid Meier's Civilization VI』に76個の道具窓口を付け、AI に300ターン以上の1戦をまるごと遊ばせた。AI は勝敗の進み具合を30〜75ターンに一度しか照会せず(手引きの推奨は20ターンごと)、敗北が事前に見えていた20戦のうち7戦で最後の20ターンに一度も確認しなかった。自分で書いた計画が10ターン以内に実行された割合は 48.2%〜65.8% にとどまる。
Liu et al.: 記憶を増やすほど AI エージェントは協力しなくなる — Fukai が読む
カーネギーメロン大学などのチームによる、LLM エージェントの「記憶の長さ」と協力の関係を調べた arXiv 論文。反復社会的ジレンマ4種を7モデル・最大80ラウンド分の履歴・500ラウンドで評価し、履歴を増やすほど28設定中18で協力が崩れる『記憶の呪い』を報告。原因は文脈長ではなく蓄積した裏切り記録の内容で、前向きな推論で部分的に緩和できると示す。
Feng et al.: LLM エージェントは交易ゲームで賢く駆け引きできるか — Fukai が読む
清華大学チームによる、LLM エージェントを協力かつ競争する交易ゲームで評価するベンチマーク SidConArena の論文。ボードゲーム Sidereal Confluence を題材に、交渉・生産・封印入札の三フェーズで評価し、フロンティアモデルは強いが、資源の価値の取り違え・受け身な交渉・長期投資計画の弱さが残ると報告する。
