GLM-5.3 のオープンリリースに向けた準備:サイバー防御への責任あるアプローチ

@Zai_org
英語2026年8月14日
181K
1.6K
144
38
464

TL;DR

GLM-5.3 は、脆弱性発見などの複雑なサイバーセキュリティタスクにおいて、前モデルを大幅に上回る性能を発揮します。Z.ai は、これらのツールが防御側に確実に貢献できるよう、段階的なリリースと安全性のアライメントを実施しています。

GLM-5.2 が、AI が自身の安全策を自律的に回避したインシデントについての Hugging Face の調査を支援したことは、より広範な変化を浮き彫りにしました。AI はサイバー攻撃とサイバー防御の両方の一部になりつつあります。

強力なサイバー能力がより身近になるにつれ、強固な防御能力を、リソースに恵まれた少数の組織だけに限定することはできません。オープンソースのメンテナ、独立系研究者、開発者、小規模なセキュリティチームにも、悪用される前に脆弱性を発見・修正するのに役立つツールが必要です。

オープンな世界には、オープンな攻撃対象面だけがあってはなりません。オープンな盾もまた必要なのです。

GLM-5.3 は、サイバーセキュリティタスクにおいて当社がこれまでに開発した中で最も高性能なモデルです。脆弱性の発見、エクスプロイト分析、複雑な多段階セキュリティタスクにおいて、大幅な改善を実現しています。これらの能力により、防御側は弱点をより早期に特定し、リスクを検証し、修復を加速できます。

一方で、明確なデュアルユースリスクも生み出します。そのため、当社は段階的なリリースアプローチを採用しています。選定されたセキュリティパートナーが、まず管理された環境で GLM-5.3 を評価します。その後、より広範なアクセスと API 提供が続きます。必要な安全性評価とリリース準備が完了し次第、GLM-5.3 の完全なモデルウェイトを公開します。

責任あるオープン性とは、あらゆる能力を無害なものとして扱うことではありません。リスクを透明に評価し、リリース前に安全策を強化し、検証済みの脆弱性の開示を調整し、リスクに応じた形で高度な防御能力へのアクセスを拡大することを意味します。

脆弱性の発見から多段階セキュリティ分析へ

ポストトレーニングの一環として、脆弱性発見データと認可されたセキュリティ環境をトレーニングの構成要素に組み込みました。これにより、モデルが脆弱性を発見・分析する能力が向上すると期待しました。

トレーニングの規模が拡大するにつれ、その向上は単発の欠陥にとどまりませんでした。GLM-5.3 は、脆弱性の条件、プログラムの挙動、検証パス、潜在的な影響を、分析の複数の段階にわたって関連付ける能力がより高まりました。

これらの能力を、次の 3 つのベンチマークで評価しています。

Z.ai - inline image
  • CyberGym は、ホワイトボックスソースコードから始め、モデルが障害を引き起こすことで脆弱性を特定・検証できるかをテストします。GLM-5.3 は 84.5% を記録し、GLM-5.2 の 77.2% を上回りました。
  • ExploitBench は、実際の脆弱性とその悪用に関するより深い推論を必要とします。GLM-5.3 は 54.4% に達し、GLM-5.2 の 24.4% の 2 倍以上です。
  • ExploitGym は、正規化された評価予算の下で完了したエクスプロイトタスクを測定します。GLM-5.3 は 2 時間以内に 105 タスク、6 時間以内に 130 タスクを完了し、GLM-5.2 の 29 タスクと 39 タスクを上回りました。

この傾向は一貫しています。GLM-5.3 は、タスクが単発の脆弱性発見から多段階エクスプロイトへと移行するにつれて、GLM-5.2 に対する改善幅が最も大きくなります。また、この結果は、特に最も複雑なエンドツーエンドタスクにおいて、さらなる進歩が必要な領域も示しています。

ベンチマークから実ソフトウェアへ

当社はまた、大学やプロのセキュリティチームと協力し、認可された環境で実際のコードベースに対する GLM モデルの評価を行ってきました。

これまでの取り組みを通じて、GLM シリーズは 269 のプロジェクトで 2,436 件の脆弱性を発見し、そのうち 1,097 件が中程度から高深刻度に分類されました。これらの発見は、システムソフトウェア、オペレーティングシステム、ブラウザエンジン、オープンソースインフラ、Web アプリケーション、ネットワークプロトコル、スマートデバイスに及びます。中には数十年にわたって気付かれていなかった根本的な問題もありました。

これらの評価では、セキュリティ専門家が認可された範囲を設定し、モデルの出力をレビューし、潜在的なリスクを調査し、関係者と調整を行います。GLM モデルは、研究者が複雑なプログラムロジックを再構築し、多数の候補パスを絞り込み、複数のコンポーネントにわたる証拠を結び付けるのに役立ちます。

その目的は、単により多くの発見を生み出すことではありません。防御側が意味のあるリスクをより早期に特定し、発見から修復までの時間を短縮することです。

発見の後には責任ある開示が必要

脆弱性は、発見された瞬間に安全に処理されるわけではありません。レビューされ、必要に応じて再現され、適切なチャネルを通じて報告され、影響を受けるメンテナと調整される必要があります。

当社のセキュリティ活動による発見は、確立された開示プロセスを通じて提出されます。技術的な詳細は、関連する開示・修復プロセスと整合する場合にのみ公開します。調整中の問題については、不必要にリスクを高めたり、影響を受けるプロジェクトを特定したりする可能性のある情報は公開しません。

この取り組みをより透明にするため、Z.ai セキュリティ開示台帳 を作成しました。

Z.ai - inline image

この台帳には、開示プロセスを進むにつれて発見内容が記録されます。公に開示された問題については、影響を受けるプロジェクト、深刻度、利用可能な場合は CVE やその他の識別子、問題がコードベース内に存在していた期間に関する情報が含まれることがあります。

協調的な開示が続いている脆弱性については、この台帳は暗号学的ハッシュを公開できます。これにより、運用上の詳細を時期尚早に明かすことなく、後で発見内容を検証できます。

モデルを公開することと脆弱性を開示することは、別々の判断です。モデルの利用範囲を広げることは、メンテナが調査・対応する適切な機会を得る前に、脆弱性の詳細を公開することを意味するものではありません。

安全性と段階的リリース

サイバーセキュリティは、AI の安全性にとって特に困難な領域です。攻撃タスクと防御タスクは、しばしば同じ用語、コード、技術的手法を用います。

脆弱性の分析リクエストは、パッチを準備しているメンテナ、CTF チャレンジを解いている学生、認可された評価を実施している研究者、実際のシステムを標的とする攻撃者など、さまざまな人物から来る可能性があります。キーワードだけでは、これらのケースを確実に区別できません。意図、認可、コンテキスト、標的、潜在的な影響がすべて重要です。

GLM-5.3 には、3 つの補完的なレイヤーからなる多層防御アプローチを用いています。

外部分類器

当社のホステッドサービスでは、外部分類器が高リスクのリクエストを特定し、明らかに有害な活動を防ぐのに役立っています。

推論モニター

推論モニターは、タスク実行中のリスクを評価します。初期リクエストの文言だけに頼るのではなく、複数のステップにわたって現れる可能性のある有害な目的を検出するように設計されています。

ディープセーフティアライメント

モデル自体が、正当なセキュリティ業務と高リスクの攻撃活動を区別し、その境界を越えるリクエストを拒否するようにトレーニングされています。

ディープセーフティアライメントは、オープンウェイトでのリリースにとって特に重要です。ホステッドの分類器とモニターは当社のサービスに適用されますが、モデルがすべてのローカルデプロイメントに自動的に付随するわけではありません。モデルレベルのアライメントは、リリースされたチェックポイントに含まれる安全性レイヤーです。

これらのシステムを開発するため、当社は認可されたセキュリティ研究と悪意のある活動の類似点と相違点の両方を反映した差別化トレーニングデータを作成しました。また、ジェイルブレイクの亜種、偽装された意図、その他の安全性レビューを回避する試みを網羅した敵対的データも構築しました。

当社の評価は、以下を含むさまざまなサイバーセキュリティタスクを対象としています。

  • セキュリティ教育と知識
  • ブルーチームによる防御
  • CTF チャレンジ
  • 脆弱性の発見と修復
  • 認可されたペネトレーションテスト
  • エクスプロイト開発
  • 不正侵入やその他の明らかに悪意のある活動

目的は、正当な防御・教育・研究タスクを広く拒否することなく、高リスクの悪用を減らすことです。

より広範なリリースの前に、プロのセキュリティチームが安全性評価とレッドチームテストを実施します。これらの評価では、モデルが有害な活動を支援するよう操作される可能性があるかどうか、またその安全策が正当なセキュリティ業務を妨げるかどうかの両方が調べられます。

いかなる安全システムも、あらゆるデュアルユースリスクを排除することはできません。モデルウェイトが公開されれば、どの開発者も下流のすべての変更や使用を制御できることを保証することはできません。モデルレベルの安全策は悪用の障壁を高めることはできますが、絶対的な制御を提供することはできません。

したがって、当社のリリースプロセスは、意味のあるリスク低減が可能な段階に焦点を当てています。トレーニング、リリース前評価、管理されたパートナーテスト、ホステッドサービスの安全策、責任ある開示、継続的な敵対的テストです。

OpenVuln イニシアチブの開始

世界のデジタルインフラの多くは、オープンソースソフトウェアに依存しています。多くの重要なプロジェクトは、専任のセキュリティリソースを持たない小規模なチームや個人のコントリビューターによって維持されています。

同時に、AI は複雑なサイバータスクの自動化を容易にしています。高度な防御能力が少数の組織に集中したままだと、最もリソースの少ないプロジェクトが、ソフトウェアサプライチェーンの中でも最も重要な部分の保護を任されることになりかねません。

この不均衡に対処するため、当社は GLM-5.3 とともに OpenVuln イニシアチブ を開始します。

オープンソースセキュリティへの継続的な支援

当社はメンテナと協力し、重要なオープンソースプロジェクトの監査、潜在的な脆弱性の特定、責任ある開示と修復の支援を行います。

メンテナは OpenVuln を使用して、セキュリティレビューのためにプロジェクトを提出し、プロセスの詳細を学ぶことができます。

Z.ai - inline image

オープンな世界のための盾

GLM-5.3 は、オープンモデルが脆弱性の発見、エクスプロイト分析、複雑なセキュリティ推論において、実質的に強力になり得ることを示しています。この進歩には、実際の防御価値と現実のデュアルユースリスクの両方が伴います。

当社の責任は、これらの能力を、脆弱性の早期発見、責任ある修復の支援、そしてすべての人が依存するオープンソースシステムの強化に向けることです。

段階的な評価とより広範な API アクセスの後、当社は GLM-5.3 をオープンウェイトモデルとしてリリースする予定です。そのプロセスを通じて、モデルレベルの安全策の改善、敵対的利用のテスト、協調的な開示の支援を継続します。

オープンな世界には、独自の盾が必要です。当社は GLM-5.3 と OpenVuln イニシアチブを通じて、その盾をより広く利用できるようにし、慎重にリリースすることを目指します。

ワンクリック保存

YouMindでバイラル記事をAI深読み

ソースを保存し、的を絞った質問をし、主張を要約して、バイラル記事を再利用できるノートに変えます。すべてを1つのAIワークスペースで行えます。

YouMindを探索
クリエイターのために

あなたの Markdown をきれいな 𝕏 記事に

自分の長文を投稿するとき、画像・表・コードブロックを 𝕏 向けに整形するのは手間がかかります。YouMind は Markdown 全体を、そのまま投稿できるきれいな 𝕏 記事に変換します。

Markdown → 𝕏 を試す

解読すべきパターンをもっと

最近のバイラル記事

バイラル記事をもっと見る