AIがW杯で賭ける、予測力を実戦で比較
複数の生成AIにW杯の試合情報を調べさせ、仮想資金を賭けさせて予測力を比較する実験が行われている。
なぜ重要か
- •AIの性能評価を標準テストから実世界の意思決定へ広げている。
- •調査、判断、資金配分を自律的に行うエージェントの実力が問われる。
- •スポーツ予測はAIのリスク管理を検証する実験場になっている。
数字で見る
- •各モデルに仮想の1万ドルを配分
転用先
原文概要
スタートアップObsideは、ChatGPT、Gemini、Claude、Grok、Mistral、DeepSeek、KimiにW杯の試合へ仮想資金を賭けさせている。各モデルは試合前にチーム、負傷者などの公開情報を調べ、仮想の1万ドルから賭け金を決める。準決勝後の時点ではMistralが首位で、OpenAIのGPT 5.5、DeepSeek V4が続いていた。