NVIDIA、300超のエージェントスキルを同じ検査器で評価
NVIDIAが、AIエージェント向けスキルの効果を測る「SkillEvaluator」を公開した。静的検査、類似スキルとの差分確認、隔離環境での実タスクという3段階で、スキル導入前後の性能差を「Skill Lift」として数値化する。
キーポイント
- 30超のNVIDIA製品にまたがる、300超の検証済みスキルを評価した
- 同じタスクをスキルあり・なしで実行し、結果の差をポイントで示す
- 評価軸は正確性、発見性、有効性、効率性、安全性の5つ
- Skill Liftは全体平均31ポイント、安全性を除くと39ポイントだった
- エージェント基盤の違いより、製品領域と評価設計の方が結果へ強く影響した