Skip to content

Latest commit

 

History

6 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 

Repository files navigation

POMDPを用いた自律型攻撃エージェントの設計と評価

筑波大学 / 情報セキュリティ研究会(ICSS)2026年5月26日 登壇発表

このリポジトリは卒業研究の 公開用ショーケース です。
研究の概要・モデル設計・実験結果・発表情報を公開しています。
詳細な実装(攻撃シミュレーションコード・ネットワーク構成・実験データ)は、セキュリティ上の理由から非公開リポジトリで管理しています。


研究概要

外部 C&C サーバなしで自律動作する攻撃エージェントの脅威が現実化しつつある現状を踏まえ、攻撃プロセスを 部分観測マルコフ決定過程(POMDP) で定式化した卒業研究。

攻撃者は標的システムの真の状態を直接観測できないという特性に着目し、ベイズ更新による信念状態管理 でタイミングを自律判断する攻撃エージェントを単独で設計・実装。単一ホストから多セグメントネットワークまで 7 段階の実験 で有効性を定量評価し、防御側への示唆を導出した。

項目 内容
論文タイトル POMDPを用いた自律型攻撃エージェントのネットワーク環境における実装と評価
学会発表 情報セキュリティ研究会(ICSS)2026年5月26日 / 機械振興会館
所属 筑波大学 理工情報生命学術院 / 指導:八槇 博史 先生(東京電機大学)
受賞 東京電機大学 システムデザイン工学部 学部長賞(2026年3月)
実装規模 約 2,900 行(Python 3.13)

担当役割

個人卒業研究として実施。設計・実装・評価・論文執筆・学会発表のすべてを単独で担当。

担当工程 内容
POMDP モデル設計 状態空間・行動空間・報酬関数のパラメータ設計(Phase ごとに拡張)
仮想ネットワーク構築 VirtualBox / VMware / GNS3 による評価環境の構築
エージェント実装 belief 更新・方策計算・実ネットワーク SSH 接続の全実装
実験・評価設計 Phase 1〜7 の段階的実験設計と Greedy / Random / Wait との定量比較
統計検定 Welch の t 検定による結果の有意性検証
論文・発表 卒業論文(2026.02)・ICSS 登壇発表(2026.05)

POMDPモデル

攻撃プロセスを 7 つ組 $(S, A, O, T, Z, R, \gamma)$ で定式化した。

状態空間 S(4状態)

状態 意味
initial 偵察前の初期状態
probing 脆弱性・サービス発見
compromised 侵入成功(吸収状態)
detected 攻撃検知・終了(吸収状態)

行動空間 A

  • Phase 1–5(5行動)wait / ssh_scan / vuln_scan / ssh_login / exploit
  • Phase 6(11行動):水平展開対応で mysql_exploit / credential_harvest / pivot_attack 等を追加

信念状態とベイズ更新

観測 $o$ を取得するたびに信念 $b(s)$ を以下の式で更新する:

$$b'(s') = \eta \cdot Z(o \mid s', a) \cdot \sum_s T(s' \mid s, a) \cdot b(s)$$

初期信念:initial 0.85 / detected 0.10 / probing 0.05

報酬関数 R

条件 報酬
exploit @ compromised +200
攻撃検知(各行動) −100 〜 −160

直面した課題と解決策

1. wait 過剰問題(成功率 0%)

設計初期、エージェントが wait のみを選択し続け侵入成功率が 0% になった。

  • 原因:初期報酬設計では wait の安全コストが低く、探索より回避が支配的になった
  • 解決:報酬比率を体系的に再設計(侵入成功 +200、検知ペナルティ −100〜−160)
  • 結果:成功率 0% → 100%、累積報酬 +340.73(比較 3 方策はすべて負)

2. 先読み深度の計算量爆発(×6,678)

先読み深度 H を増やすほど性能が向上すると仮定したが、H=4 は H=1 比 6,678 倍 の計算量になり実用限界を超えた。

  • 解決:H=1(1ステップ先読み)が精度・速度のバランス最良であることを定量評価で確認
  • 教訓:POMDP の実用化には計算量制約の明示的な評価が不可欠

3. 行動空間拡大による探索困難化

Phase 6 で 11 行動へ拡張したところ、侵入成功率が SSH 単独 62.5% → 3 ベクトル 6.2% に大幅低下した。

  • 解決方向:大きな行動空間には POMCP 等のオンラインソルバや深層強化学習との統合が必要という知見を得た
  • 発展:この課題が大学院でのハイブリッド型エージェント研究テーマの起点となった

実験結果

Phase 1–5:単一ホスト ベースライン比較

比較対象:Greedy / Random / Wait-Only の 3 方策(Welch の t 検定で有意差を確認)

指標 結果
POMDP 累積報酬 +340.73(比較 3 方策はすべて負)
侵入完了ステップ数 4 ステップ(ssh_scan → exploit ×3 の最短経路を自律選択)
先読み H=4 vs H=1 の計算量比 ×6,678 増加 → H=1 が最良

Phase 6:マルチホスト(4台・SSH / MySQL / Samba)

指標 結果
対 Greedy 改善率 +14%(低検知環境・感度 0.1)
credential_harvest の効果 累積報酬 +24.1%・侵害ホスト数 +28.6% 改善
3 ベクトル時の侵入成功率 6.2%(SSH 単独 62.5% から低下)

Phase 7:ファイアウォール・3 セグメント分離(5台)

指標 結果
Confidential セグメント到達率 25.0%(多層防御の定量的効果を確認)
FW ブロック回数 0 回(許可経路のみを信念状態から自律選択)
累積報酬 +68.8

考察・防御側への示唆

  • 信念状態による優位性:Greedy は probing 状態で ssh_login を繰り返し exploit 機会を逃すが、POMDP は信念が閾値を超えた時点で exploit を選択できる
  • 攻撃ベクトルの逆説:攻撃経路を増やすほど行動空間が拡大し成功率が低下 → 防御側はダミー経路の設置で攻撃エージェントを混乱させられる可能性
  • 認証情報管理の重要性credential_harvest の効果から、bash_history・設定ファイルの適切な管理・定期ローテーションが横展開阻止に直結
  • 多層防御の定量的効果:ゼロトラスト・マイクロセグメンテーションが Confidential 到達率を 25% に制限。IDS 感度 0.2 以上で POMDP 優位性を抑制可能

使用技術

項目 詳細
言語 Python 3.13.4
数値計算 NumPy(行列演算・belief ベクトル更新)
データ処理 pandas(実験結果 CSV 管理・統計)
可視化 matplotlib / seaborn
ネットワーク接続 Paramiko(SSH 接続・コマンド実行)
仮想環境 VirtualBox / VMware / GNS3 + Ubuntu 22.04
設定管理 YAML(状態・行動・確率・報酬を宣言的に定義)

今後の発展(大学院での研究テーマ)

テーマ 概要
マルチエージェント化(Dec-POMDP) 偵察・侵入・横展開を複数エージェントが役割分担する協調モデルへ拡張
ローカルLLMとのハイブリッド統合 POMDP が確率的意思決定を、LLM がログ解析・未知環境での行動候補生成を担う
深層強化学習との統合 DQN・PPO により大規模ネットワーク(16ホスト以上)での実用化
防御側の意思決定支援 攻撃モデルを逆用した防御戦略評価・IDS チューニング支援

このリポジトリについて

本リポジトリには、理論的背景と実験結果の説明、および belief 更新の概念デモコードを収録しています。
詳細な実装(ネットワーク攻撃シミュレーションコード)は、倫理的配慮およびセキュリティ上の理由から非公開リポジトリで管理しています。

研究・学習目的での参照は歓迎します。悪意ある目的への利用はお断りします。

About

部分観測マルコフ決定過程(POMDP)を用いた意思決定モデルの概念実装デモ。 不確実性下の行動選択を数理的に再現した研究抜粋版。

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages