XPENG、車載と人型ロボ向け視覚基盤を公開
XPENGがスマート運転やスマートコックピット、人型ロボットに使う視覚エンコーダー「TuringViT」を公開した。
なぜ重要か
- •自動運転と人型ロボットで共通利用できる視覚基盤を示した。
- •高解像度処理で既存モデルを上回るスループットを訴求している。
- •車載AIとロボットAIを横断するモデル開発の動きが進んでいる。
数字で見る
- •TuringViTは18Lと24Lの2種類。
- •1536×1536解像度で、TuringViT-18LはSeed1.5-ViTの3.04倍、SigLIP2-ViT-Lの2.16倍のスループットとされる。
転用先
原文概要
XPENGは、視覚言語モデルや視覚言語行動モデルに使う視覚エンコーダー「TuringViT」を公開した。スマート運転、スマートコックピット、IRON人型ロボット計画での利用を想定し、18Lと24Lを提供する。1536×1536解像度で、18Lは複数の既存視覚モデルを上回るスループットを示したとしている。