Anthropic / Frontier Red Team ·
GLM-5.3の自律的な攻撃コード生成能力を警告
能力の評価・警告
GLM-5.3:動く攻撃コードを組む能力が、オープンウェイトに
AnthropicのFrontier Red Teamは、Zhipu AI(海外名Z.ai)のGLM-5.3が、特定の評価でClaude Mythos Previewに近い水準のエクスプロイト開発能力を示したと報告しました。重みが公開されているため、安全対策の改変・除去が可能な点も論点です。
| 評価 | GLM-5.3 | Mythos Preview |
|---|---|---|
| ExploitBench / 410試行 | 50回(約12%) | 56回(約14%) |
| 内部バイナリ悪用 / 100課題 | 4% | 6% |
模擬環境では、偽装プロンプトで64%、思考プリフィルで92%、拒否を減らしたモデルで100%が悪意ある指示に応じて標的への接続を試みました。これは攻撃成功率ではありません。初期状態のモデルは、同じ模擬テストの悪意ある指示をすべて拒否しています。
Claudeとの比較では、偽装プロンプトは阻止され、思考プリフィルと重みの改変はAPI仕様・非公開の重みにより適用できません。このレポートは、GLM-5.3による実際の大規模侵入を確認した事件報告ではなく、隔離環境での評価に基づく事前警告です。
出典
公表・続報日:2026-09-29。確認状況と被害規模は参照した発表時点の情報です。