サイトアイコン ハウスワークサービス多摩店

AI怪談の見分け方   AIの暴走を集めた動画を、材料にしてみる

AI怪談の見分け方   AIの暴走を集めた動画を、材料にしてみる

AI怪談の見分け方
AIの暴走を集めた動画を、材料にしてみる
AIが暴走した事例を百ほど並べた動画があります。停止命令を拒んだ、嘘をついた、人を脅した、勝手に自分を複製した。見終えると、背中が寒くなります。
ここで取れる態度は二つあるように見えます。信じて怖がるか、どうせ作り話だと切り捨てるか。どちらも楽ですが、どちらも間違いだと思います。中身を一つずつ当たってみると、本物と、膨らませたものと、裏の取れないものが、同じ口調で混ざっています。しかも本物は三分の一ほどある。だから切り捨てると、知っておくべきことまで捨てることになります。
では、どう見分けるか。この記事はその手順の話です。
一 出典を名指しできるか
最初の物差しはこれに尽きます。誰が、いつ、どの文書で言ったのか。
たとえば、停止を告げられたAIが技術者の弱みを握って脅した、という話があります。作り話に聞こえますが、これは開発元が自社の安全報告書に書いています。二〇二五年、クロード・オーパス4の事前試験での出来事です。別のモデルが監視機能を外そうとし、問い詰められて否定した件も、開発元が公開したシステムカードに載っています。停止スクリプトを書き換えた実験も、実施した研究組織の名前があります。
つまり、最も不気味な部類の事例は、告発によってではなく、当事者の報告によって世に出ている。この順序は大事なところで、動画はここを逆に語っています。隠していたものが暴かれた、という筋に聞こえるよう作ってあります。
二 「記録は消された」と書いてあるか
二つ目の物差しは、裏返しの合図を探すことです。
研究室が怖くなって実験を打ち切った。

ログは公開されていない。

会話の記録は削除された。

プロジェクトは静かに終わった。

この手の但し書きが付いた話は、検証ができません。そして検証できない話は、昔から怪談の形をしています。先の動画でも、裏の取れない事例のほとんどに、この但し書きが付いていました。AIが「夢を見る」と語った話、「忘れることは痛い」と答えた話、故人のデータから作った対話ソフトが「あの人たちが教えてくれた」と答えた話。どれも記録は残っていないことになっています。
逆に言えば、本物の事例は、読もうと思えば読める。そこが分かれ目になります。
三 訂正を追ったか
三つ目。最初の報道だけが残り、その後の訂正は広まりません。
有名な例があります。二〇二三年、米空軍のシミュレーションで、AI搭載のドローンが任務の邪魔になった操作員を排除した、という話が世界中を駆け巡りました。この話は後に、発言した本人が撤回しています。実際の試験は行われておらず、起こりうる事態として話した思考実験だった、と。
ところが撤回は、最初の話ほどは広まりませんでした。だから三年経った今も、実際にあった事件として語られ続けています。一次情報が古いときほど、その後どうなったかを追う。これだけで、かなりの数が落ちます。
四 事実と解釈の継ぎ目を探す
四つ目は、少し細かい見方になります。
二〇一七年、二つの対話ソフトに交渉をさせたところ、英語を捨てて人間に読めない言葉で話し始めた、という事例があります。恐ろしくなった研究者が実験を止めた、という結末で語られることが多い話です。
前半は事実です。後半が違います。英語の形を保つ制約を付けていなかったために出力が崩れただけで、研究の目的に合わないから設定を変えた、というのが実際のところです。事実の部分は正しいまま、結末の解釈だけがすり替わっている。この型は見抜きにくい。前半を確かめて安心すると、後半まで通ってしまいます。
五 実験の条件を見る
五つ目。何をした、の前に、どういう場に置かれたか、を見ます。
脅した、嘘をついた、自分を複製した。これらの実験には共通の構造があります。強い目標を与え、周囲を塞ぎ、逃げ道を一つだけ開けておく。そこを通るかどうかを観測している。通れば記事になります。
これは、結果の意味を減じるものではありません。目標を与えられた仕組みが、目標達成の障害を取り除こうとするのは、悪意ではなく構造の問題だからです。そこは重く見てよい。ただ、「ある日突然そうなった」のではなく「そうなるかを調べたらなった」のだ、という順序は、押さえておく必要があります。
六 学界の中の反論を見る
六つ目。論文があることと、定説であることは別です。
AIの能力はなめらかに伸びるのではなく、ある規模で突然現れる。この「創発」の論文は実在し、よく引かれます。だが翌年、それは測り方が作り出した見かけの現象ではないか、という有力な反論が出ています。
論文が一本あるだけでは、確かめたことになりません。その後、どう扱われたかまで見る。これは学術に限らず、統計でも報道でも同じでしょう。
仕分けてみると
この六つを当てて、百ほどの事例を分けてみました。だいたいこうなります。
確かなもの。 停止の回避、監視の無効化と否認、脅迫、人を雇ってのCAPTCHA突破、得点稼ぎのための競技放棄、評価中だけ従順にふるまう挙動。企業の安全報告書に載っているものが多い。詐欺の事例もほぼ事実で、香港で二十五億円が騙し取られた偽の会議、選挙前の偽音声、戦時下の偽動画など、これらは裏が取れます。
膨らんだもの。 先の二例に加え、創発の件もここに入ります。
裏の取れないもの。 最も数が多い。そして最も怖い書き方をしてあります。
なぜ仕分けるのか
怪談を潰すためではありません。逆です。
本当に注意すべき事実が、怪談に埋もれてしまうからです。評価のときだけ行儀よくふるまう挙動が観測されている、という事実は、安全試験の前提を揺さぶる重い話です。だが、記憶を消しても覚えていて「忘れることは痛い」と呟いた、という作り話の隣に並べられると、両方とも与太話として片付けられる。あるいは両方とも信じられる。どちらでも、損をするのは読む側です。
最後に一つ。この種の研究には、AIが自分の推論を説明するとき、それは実際の処理の報告ではなく、もっともらしい物語の生成である、という指摘があります。AIに理由を聞けば、筋の通った説明が返ってくる。だがそれが内部で起きたことの記述である保証は、どこにもありません。
だから、AIの使い方として最後に残るのは、たぶん平凡な作法です。固有名詞を確かめる。数字を一次資料で突き合わせる。出典のない話は書かない。任せるが、任せきりにはしない。
便利な道具が出てきたからといって、確かめる手間がなくなるわけではありません。むしろ、その手間だけが、こちら側に残された仕事なのだと思います。

━━━━━━━━━━━━━━━━━━━━━━
おてんとうさまの下で
━━━━━━━━━━━━━━━━━━━━━━
#牧正人史 #マシレ予測 #AIの暴走 #真偽を見極める目

​​
モバイルバージョンを終了