コンテンツにスキップ

Kimi K3のCyber能力評価 ― Open-weight AIを「モデル名」ではなく能力で評価する

Executive Summary

UK AISIと米国CAISI/NISTは2026年7月23日、Moonshot AIのKimi K3についてCyber Capabilityの共同評価結果を公表しました。Kimi K3は最新のFrontier Cyber-capable Modelより低い性能だった一方、GLM-5.2を上回り、模擬企業Networkの32段階Attack Pathで平均17段階まで到達し、10回中1回は全経路を完了しました。1

重要なのは特定モデルの優劣ではなく、Open-weight / Closed-weightを問わず、AIのCyber能力を継続測定する仕組みが必要になったことです。

なぜ今なのか

AI ModelのCyber能力は、Coding Benchmarkだけでは判断できません。

Exploit Development、Privilege Escalation、Network Attack、長時間Agent Taskなど、実際の攻撃チェーンに近い評価が必要です。同時にBenchmarkは実環境と異なるため、数値をそのまま実攻撃成功率として解釈することも危険です。

評価結果をどう読むか

NIST公表の主なポイントは以下です。

  • Kimi K3は最新Frontier Modelより低い
  • GLM-5.2より高いCyber Capabilityを示した
  • ExploitBenchで32%のScore
  • 模擬Corporate Networkで平均17/32 step
  • 10試行中1回は全Attack Pathを完了
  • SafeguardはOffensive Cyber Taskの試行を完全には止めなかった

一方、評価環境にはActive Defenderが存在せず、意図的に攻撃経路が用意されているなど、Real Worldとの差があります。

経営インパクト

観点 影響
Model Selection Performance / CostだけでなくCyber Capabilityも評価対象になる
Open-weight Risk Weight公開時は組織側Safeguardへの依存度が上がる
Vendor Risk 「安全です」というVendor Claimだけでは不十分
Monitoring Model UpdateごとにRisk Ratingを更新する必要

日本企業への示唆

企業が外部AI Modelを採用する際、Security Checklistを「Dataを学習利用するか」だけで終わらせないことが重要です。

Code Execution、Tool Use、Network Access、Agent Autonomyがある場合、モデルのCyber CapabilityとRuntime Controlを組み合わせて評価する必要があります。

推奨アクション

  1. AI Model InventoryにCapability Riskを追加する
  2. Coding / Agent用途ではCyber Capability評価結果を確認する
  3. Open-weight ModelはRuntime Safeguardを組織側で実装する
  4. Tool / Network / Credential Accessを能力に応じて制限する
  5. Model Version更新時にRisk Assessmentを再実施する

用語解説

ExploitBench
脆弱性に対してExploit Developmentの各段階をどこまで進められるかを測定するBenchmark。

Cyber Range
攻撃・防御能力を評価するために構築された模擬Network環境。

関連記事

参考情報