Kimi K3のCyber能力評価 ― Open-weight AIを「モデル名」ではなく能力で評価する
Executive Summary
UK AISIと米国CAISI/NISTは2026年7月23日、Moonshot AIのKimi K3についてCyber Capabilityの共同評価結果を公表しました。Kimi K3は最新のFrontier Cyber-capable Modelより低い性能だった一方、GLM-5.2を上回り、模擬企業Networkの32段階Attack Pathで平均17段階まで到達し、10回中1回は全経路を完了しました。1
重要なのは特定モデルの優劣ではなく、Open-weight / Closed-weightを問わず、AIのCyber能力を継続測定する仕組みが必要になったことです。
なぜ今なのか
AI ModelのCyber能力は、Coding Benchmarkだけでは判断できません。
Exploit Development、Privilege Escalation、Network Attack、長時間Agent Taskなど、実際の攻撃チェーンに近い評価が必要です。同時にBenchmarkは実環境と異なるため、数値をそのまま実攻撃成功率として解釈することも危険です。
評価結果をどう読むか
NIST公表の主なポイントは以下です。
- Kimi K3は最新Frontier Modelより低い
- GLM-5.2より高いCyber Capabilityを示した
- ExploitBenchで32%のScore
- 模擬Corporate Networkで平均17/32 step
- 10試行中1回は全Attack Pathを完了
- SafeguardはOffensive Cyber Taskの試行を完全には止めなかった
一方、評価環境にはActive Defenderが存在せず、意図的に攻撃経路が用意されているなど、Real Worldとの差があります。
経営インパクト
| 観点 | 影響 |
|---|---|
| Model Selection | Performance / CostだけでなくCyber Capabilityも評価対象になる |
| Open-weight Risk | Weight公開時は組織側Safeguardへの依存度が上がる |
| Vendor Risk | 「安全です」というVendor Claimだけでは不十分 |
| Monitoring | Model UpdateごとにRisk Ratingを更新する必要 |
日本企業への示唆
企業が外部AI Modelを採用する際、Security Checklistを「Dataを学習利用するか」だけで終わらせないことが重要です。
Code Execution、Tool Use、Network Access、Agent Autonomyがある場合、モデルのCyber CapabilityとRuntime Controlを組み合わせて評価する必要があります。
推奨アクション
- AI Model InventoryにCapability Riskを追加する
- Coding / Agent用途ではCyber Capability評価結果を確認する
- Open-weight ModelはRuntime Safeguardを組織側で実装する
- Tool / Network / Credential Accessを能力に応じて制限する
- Model Version更新時にRisk Assessmentを再実施する
用語解説
ExploitBench
脆弱性に対してExploit Developmentの各段階をどこまで進められるかを測定するBenchmark。
Cyber Range
攻撃・防御能力を評価するために構築された模擬Network環境。