↑: [[G検定に関する知識]] - 安全性(Safety):悪意なき失敗を防ぐ。AIが間違えても大事故にならない備え(誤作動・予期せぬ出力・データの偏りによる誤り) - セキュリティ(Security):意図的な攻撃から守る。攻撃者がいる前提で考える - AIへの攻撃対象は3つ:①入力(推論時)、②学習データ、③モデルそのもの - 入力を狙う攻撃:[[アドバーサリアル・アタック]](敵対的攻撃) - データを狙う攻撃:[[データ・ポイズニング]](混入)、データ窃取(抜き出す) - モデルを狙う攻撃:[[モデル汚染]](改変)、モデル窃取(API経由で複製) - LLM特有:[[プロンプト・インジェクション]](本来の指示を乗っ取る) - 対策原則:[[セキュリティ・バイ・デザイン]](事後の防御ではなく事前の設計で守る) - 技術的対策4つ:アドバーサリアル訓練・データ検証・[[差分プライバシー]]・モデル監査 - cf. [[アドバーサリアル・アタック]], [[データ・ポイズニング]], [[プロンプト・インジェクション]]