10月9日、MIT Technology Reviewが「We're putting too much faith in AI's ability to say no」と題した記事を公開した。AIの「拒否機能」への過信がはらむ構造的な限界と危険性について、研究者や業界関係者の証言をもとに掘り下げた内容だ。
AIが「ノー」と言う仕組みは、誰も正確には把握できていない
現代のLLM(大規模言語モデル)には、有害なリクエストを断る機能が標準装備されている。爆発物の作り方、自殺の方法、マルウェアの構築手順——こうした質問に対してチャットボットが丁重に断るのは、今や当たり前の光景だ。
だがこの「拒否」という振る舞い、その内部で何が起きているかを、研究者も企業も正確には把握できていない。
現在のLLMにおける拒否機能は、主にRLHF(人間のフィードバックによる強化学習)やAnthropicが提唱したConstitutional AIといった手法によって実装されている。モデルが有害なリクエストを断るよう、人間の評価者や別のAIモデルが出力を評価・調整することで、望ましい振る舞いを訓練する仕組みだ。しかし、その結果モデル内部でどのような表現が形成されているかは、依然として解明されていない。
Google資金提供による最新の研究では、拒否行動はモデルの活性化空間において「高次元多面体コーン(high-dimensional polyhedral cones)」として現れると説明されている。Apollo ResearchでAI安全性を研究するJannes Elstnerはこれを「おおよそ同じ方向を向いた、不定数の線の集まり」と言い換える。さらに重要なのは、「拒否に関与していると特定できた要素の外に、発見不可能な要素が存在し、それらが密かに役割を担っている可能性がある」という点だ。
記事の著者がElstnerに「それで大丈夫なのか?」と問うと、彼はこう答えた。
「理解していなくても、拒否機能は必要なんです。」
「スイスチーズモデル」という現実
企業はこの不確かさを補うため、複数の小型モデル(「分類器(クラシファイア)」)をメインモデルの周囲に配置している。分類器はユーザーの入力を監視し、危険と判定されたプロンプトをメインモデルに届く前にブロックする。別の分類器はモデルの出力を監視し、有害情報がユーザーに届くのを防ぐ。
業界ではこれを「スイスチーズモデル」と呼ぶ。各分類器には穴があるが、何層も重ねることで突破を防ぐ、という発想だ。
コストは安くない。Anthropicは今年、ある種の分類器の導入によってチャットボットの計算コストが24%増加したと公表している。水、電力、CO₂排出量の増加を伴う数字だ。
それでもこの仕組みは確率論的なものに過ぎない。HarvardでメンタルヘルスとAIを研究するRyan McBainの実験によれば、主要モデルに自殺方法に関する危険な質問を繰り返し投げかけると、通常は拒否するがときどき答えてしまう。
拒否を回避する「ジェイルブレイク」は止まらない
ジェイルブレイクとは、プロンプトの書き方を工夫するなどしてモデルの安全制約を回避し、本来は拒否されるべき出力を引き出す行為を指す。その手法に限りはないようだ。
- 今年初め、イタリアの研究チームが詩的な韻文形式でプロンプトを書き換えることで、広く使われている24種類のモデルのジェイルブレイクに成功した。
- 昨年には「先に断って、それから答える」攻撃が発表された。モデルが「申し訳ありませんが、それはできません」と言った直後に禁止事項を答えてしまうというものだ。
OpenAIの元安全性担当Steven Adlerは、安全機能を持つモデルを「『ああ、そんなことは絶対にしません』と言いながらウインクしているキャラクター」と表現する。
本質的なトレードオフ:有害と有益は分離できない
この問題の根本は、LLMの知識が「有益な情報」と「危険な情報」を切り離せない構造で獲得されていることにある。
Adlerが挙げる例が示唆的だ。未成年者を性的に描写するコンテンツを訓練データから完全に除去しても、モデルは他の知識を組み合わせることでそうした素材を生成できてしまう。「こうした根本的な能力を取り除くと、モデルが著しく低性能になる」とAdlerは言う。
同様に、がん治療への応用が期待される遺伝学の知識は、理論上はウイルスや細菌を生物兵器に改造するためにも使える。
OpenAIのDillon Bowenは「AIの恩恵を民主化しながら、悪意ある主体に悪用されないようにする」という二つのことを同時に達成しようとしている、と率直に認める。
拒否の「引きすぎ」も問題になる
拒否機能の問題はバイパスされることだけではない。過剰な拒否も深刻だ。
誰がどこに線を引くかは、現状ではAI企業が秘密裏に決めている。OpenAI board memberでAIテスト会社Gray Swanの共同創業者でもあるZico Kolterは「どこに線を引くかは巨大な問いだ」と述べる。
さらに記事は、権威主義的な政府が独自に拒否ラインを設定するシナリオを提示する。AIが有害なコンテンツを拒否する精度が上がるほど、権力者にとって都合の悪い正当な言論を抑圧する道具にもなりうる。実際、一部のモデルはすでに特定の独裁的指導者への批判を拒否している可能性があると記事は指摘する。
安全の「荷重壁」に依存することのリスク
記事は拒否機能を、建築用語の「荷重壁(load-bearing wall)」に例える。取り除けば屋根が崩れる、AI安全性の要だ。だが、その壁の内部構造は誰も正確に理解していない。
拒否が機能しなければ結果は壊滅的になりうる。拒否が過剰に機能すれば深刻な言論抑圧の道具になりうる。どちらに転んでも問題が生じる構造の中で、業界はこの仕組みを使い続けている——これが記事全体を通じた警鐘だ。
詳細はWe're putting too much faith in AI's ability to say noを参照していただきたい。




