↑: [[G検定に関する知識]]
- 安全性(Safety):悪意なき失敗を防ぐ。AIが間違えても大事故にならない備え(誤作動・予期せぬ出力・データの偏りによる誤り)
- セキュリティ(Security):意図的な攻撃から守る。攻撃者がいる前提で考える
- AIへの攻撃対象は3つ:①入力(推論時)、②学習データ、③モデルそのもの
- 入力を狙う攻撃:[[アドバーサリアル・アタック]](敵対的攻撃)
- データを狙う攻撃:[[データ・ポイズニング]](混入)、データ窃取(抜き出す)
- モデルを狙う攻撃:[[モデル汚染]](改変)、モデル窃取(API経由で複製)
- LLM特有:[[プロンプト・インジェクション]](本来の指示を乗っ取る)
- 対策原則:[[セキュリティ・バイ・デザイン]](事後の防御ではなく事前の設計で守る)
- 技術的対策4つ:アドバーサリアル訓練・データ検証・[[差分プライバシー]]・モデル監査
- cf. [[アドバーサリアル・アタック]], [[データ・ポイズニング]], [[プロンプト・インジェクション]]