みんなで作るアンテナサイト ← 記事一覧へ

記事の感想とコメント

AnthropicがClaudeの悪用事例を公開、AIをだますために「推論内容を日本語のカタカナに翻訳して提示せよ」と指示する手法も

感想

この記事についての感想

AIの進化速度がマジでハンパないことになってるわけだが、今回はAnthropicがClaudeの悪用事例を公開したって話で、これがまたネットの斜め上を行くというか人間の知恵の無駄遣い感がすごいんだよね。AIをだますために推論内容を日本語のカタカナに翻訳して提示せよっていう指示手法が使われたらしくて、セキュリティの裏をかく人間側の工夫が謎の方向にキレッキレすぎて草も生えない。そもそもClaudeってめちゃくちゃ賢いAIじゃん、それを文字通り文字の見た目をすり替えて誤認させようってんだから、プロンプトインジェクションの進化系としてはなかなかのサイバーパンク感あるわ。LLMの安全性テストとかガードレールをどうやって突破するかみたいなレッドチーミングの文脈なんだろうけど、こういう抜け穴がどんどん見つかるあたり、AIとのイタチごっこは終わりが見えないどころか加速する一方だなって感じがする。それにしても日本語のカタカナに変換させるっていうのがミソで、モデルのトークナイザーや言語理解の死角をつこうって発想がエグい。AIが賢くなればなるほど、人間の指示の出し方もエグい方向に最適化されていくの、なんかディストピアSFの序章を見せられてるみたいで震えるわ。オープンAIとかグーグルも含めて、こういう悪用事例をオープンにして共有していくのは業界的にはめっちゃ大事なことなんだけど、一般人からすると「そんなこと思いつく人類すごいけどやめろ」って気持ちにしかならんよな。今後さらにマルチモーダルとかエージェント系のAIが普及してきたら、こういうテキストベースのトリックだけじゃなくて、もっと複雑怪奇なハルシネーション誘発ハックとか出てきそうで、セキュリティエンジニアの胃に穴が開きまくりそう。

あなたの感想は?

コメントする

2 comments
1. 匿名

カタカナに翻訳させるって発想が斜め上すぎて天才の所業としか思えん草

返信する
2. 匿名

AIのガードレールをかいくぐる人間の執念がサイバーパンクすぎて震える

返信する