中国Kimi K3、AIエージェント性能で2位
Moonshot AIのKimi K3が、AIエージェントのベンチマークで2位の成績を示した一方、実行コストと時間が課題になっている。
なぜ重要か
- •中国発の大規模モデルがAIエージェント評価で存在感を高めている。
- •モデル性能だけでなく、タスク実行コストと処理時間が導入判断を左右する。
- •企業利用ではベンチマーク順位と実運用の採算性を分けて評価する必要がある。
数字で見る
- •Kimi K3は2兆8000億パラメータのモデルとして発表された。
- •AA-BriefcaseでFable 5に次ぐ2位の成績を達成した。
- •タスク1件あたりの実行時間は平均1時間近くかかる。
転用先
原文概要
Moonshot AIが発表したKimi K3について、Artificial Analysisがベンチマーク結果を公開した。Kimi K3は一部のテストでClaude Fable 5を上回る性能を示したとされ、AA-BriefcaseではFable 5に次ぐ2位となった。一方、実行コストはOpus 4.8より高く、タスクあたりの平均実行時間も長い。