筑波大学 / 情報セキュリティ研究会(ICSS)2026年5月26日 登壇発表
このリポジトリは卒業研究の 公開用ショーケース です。
研究の概要・モデル設計・実験結果・発表情報を公開しています。
詳細な実装(攻撃シミュレーションコード・ネットワーク構成・実験データ)は、セキュリティ上の理由から非公開リポジトリで管理しています。
外部 C&C サーバなしで自律動作する攻撃エージェントの脅威が現実化しつつある現状を踏まえ、攻撃プロセスを 部分観測マルコフ決定過程(POMDP) で定式化した卒業研究。
攻撃者は標的システムの真の状態を直接観測できないという特性に着目し、ベイズ更新による信念状態管理 でタイミングを自律判断する攻撃エージェントを単独で設計・実装。単一ホストから多セグメントネットワークまで 7 段階の実験 で有効性を定量評価し、防御側への示唆を導出した。
| 項目 | 内容 |
|---|---|
| 論文タイトル | POMDPを用いた自律型攻撃エージェントのネットワーク環境における実装と評価 |
| 学会発表 | 情報セキュリティ研究会(ICSS)2026年5月26日 / 機械振興会館 |
| 所属 | 筑波大学 理工情報生命学術院 / 指導:八槇 博史 先生(東京電機大学) |
| 受賞 | 東京電機大学 システムデザイン工学部 学部長賞(2026年3月) |
| 実装規模 | 約 2,900 行(Python 3.13) |
個人卒業研究として実施。設計・実装・評価・論文執筆・学会発表のすべてを単独で担当。
| 担当工程 | 内容 |
|---|---|
| POMDP モデル設計 | 状態空間・行動空間・報酬関数のパラメータ設計(Phase ごとに拡張) |
| 仮想ネットワーク構築 | VirtualBox / VMware / GNS3 による評価環境の構築 |
| エージェント実装 | belief 更新・方策計算・実ネットワーク SSH 接続の全実装 |
| 実験・評価設計 | Phase 1〜7 の段階的実験設計と Greedy / Random / Wait との定量比較 |
| 統計検定 | Welch の t 検定による結果の有意性検証 |
| 論文・発表 | 卒業論文(2026.02)・ICSS 登壇発表(2026.05) |
攻撃プロセスを 7 つ組
| 状態 | 意味 |
|---|---|
initial |
偵察前の初期状態 |
probing |
脆弱性・サービス発見 |
compromised |
侵入成功(吸収状態) |
detected |
攻撃検知・終了(吸収状態) |
- Phase 1–5(5行動):
wait/ssh_scan/vuln_scan/ssh_login/exploit - Phase 6(11行動):水平展開対応で
mysql_exploit/credential_harvest/pivot_attack等を追加
観測
初期信念:initial 0.85 / detected 0.10 / probing 0.05
| 条件 | 報酬 |
|---|---|
exploit @ compromised |
+200 |
| 攻撃検知(各行動) | −100 〜 −160 |
設計初期、エージェントが wait のみを選択し続け侵入成功率が 0% になった。
- 原因:初期報酬設計では
waitの安全コストが低く、探索より回避が支配的になった - 解決:報酬比率を体系的に再設計(侵入成功 +200、検知ペナルティ −100〜−160)
- 結果:成功率 0% → 100%、累積報酬 +340.73(比較 3 方策はすべて負)
先読み深度 H を増やすほど性能が向上すると仮定したが、H=4 は H=1 比 6,678 倍 の計算量になり実用限界を超えた。
- 解決:H=1(1ステップ先読み)が精度・速度のバランス最良であることを定量評価で確認
- 教訓:POMDP の実用化には計算量制約の明示的な評価が不可欠
Phase 6 で 11 行動へ拡張したところ、侵入成功率が SSH 単独 62.5% → 3 ベクトル 6.2% に大幅低下した。
- 解決方向:大きな行動空間には POMCP 等のオンラインソルバや深層強化学習との統合が必要という知見を得た
- 発展:この課題が大学院でのハイブリッド型エージェント研究テーマの起点となった
比較対象:Greedy / Random / Wait-Only の 3 方策(Welch の t 検定で有意差を確認)
| 指標 | 結果 |
|---|---|
| POMDP 累積報酬 | +340.73(比較 3 方策はすべて負) |
| 侵入完了ステップ数 | 4 ステップ(ssh_scan → exploit ×3 の最短経路を自律選択) |
| 先読み H=4 vs H=1 の計算量比 | ×6,678 増加 → H=1 が最良 |
| 指標 | 結果 |
|---|---|
| 対 Greedy 改善率 | +14%(低検知環境・感度 0.1) |
credential_harvest の効果 |
累積報酬 +24.1%・侵害ホスト数 +28.6% 改善 |
| 3 ベクトル時の侵入成功率 | 6.2%(SSH 単独 62.5% から低下) |
| 指標 | 結果 |
|---|---|
| Confidential セグメント到達率 | 25.0%(多層防御の定量的効果を確認) |
| FW ブロック回数 | 0 回(許可経路のみを信念状態から自律選択) |
| 累積報酬 | +68.8 |
- 信念状態による優位性:Greedy は
probing状態でssh_loginを繰り返しexploit機会を逃すが、POMDP は信念が閾値を超えた時点でexploitを選択できる - 攻撃ベクトルの逆説:攻撃経路を増やすほど行動空間が拡大し成功率が低下 → 防御側はダミー経路の設置で攻撃エージェントを混乱させられる可能性
- 認証情報管理の重要性:
credential_harvestの効果から、bash_history・設定ファイルの適切な管理・定期ローテーションが横展開阻止に直結 - 多層防御の定量的効果:ゼロトラスト・マイクロセグメンテーションが Confidential 到達率を 25% に制限。IDS 感度 0.2 以上で POMDP 優位性を抑制可能
| 項目 | 詳細 |
|---|---|
| 言語 | Python 3.13.4 |
| 数値計算 | NumPy(行列演算・belief ベクトル更新) |
| データ処理 | pandas(実験結果 CSV 管理・統計) |
| 可視化 | matplotlib / seaborn |
| ネットワーク接続 | Paramiko(SSH 接続・コマンド実行) |
| 仮想環境 | VirtualBox / VMware / GNS3 + Ubuntu 22.04 |
| 設定管理 | YAML(状態・行動・確率・報酬を宣言的に定義) |
| テーマ | 概要 |
|---|---|
| マルチエージェント化(Dec-POMDP) | 偵察・侵入・横展開を複数エージェントが役割分担する協調モデルへ拡張 |
| ローカルLLMとのハイブリッド統合 | POMDP が確率的意思決定を、LLM がログ解析・未知環境での行動候補生成を担う |
| 深層強化学習との統合 | DQN・PPO により大規模ネットワーク(16ホスト以上)での実用化 |
| 防御側の意思決定支援 | 攻撃モデルを逆用した防御戦略評価・IDS チューニング支援 |
本リポジトリには、理論的背景と実験結果の説明、および belief 更新の概念デモコードを収録しています。
詳細な実装(ネットワーク攻撃シミュレーションコード)は、倫理的配慮およびセキュリティ上の理由から非公開リポジトリで管理しています。
研究・学習目的での参照は歓迎します。悪意ある目的への利用はお断りします。