まとめ:
- HiddenLayer の研究者は、TokenBreaker と呼ばれる大規模言語モデル (LLM) に対する新しい攻撃を開発しました。
- たった 1 つの文字を追加または変更するだけで、一部のセキュリティ メカニズムを回避できます。
- 基本的な大規模言語モデル (LLM) でも、攻撃の意図を理解することができます。
セキュリティ研究者は、いくつかの組み込み保護メカニズムを回避する方法を発見した。 大規模言語モデル (LLM)悪意のある主張に対応するようにします。
HiddenLayer の Kieran Evans、Casimir Schulz、および Kenneth Young は、TokenBreak と呼ばれる新しい攻撃手法に関する詳細なレポートを公開しました。この攻撃手法は、特にバイト ペア エンコーディング (BPE) や WordPiece 戦略を使用する大規模言語モデル (LLM) がテキストをトークンに分割する方法をターゲットにしています。

トークン化とは、テキストをトークンと呼ばれる小さな単位に分割するプロセスです。トークンは単語、単語の一部、または文字などであり、大規模言語モデル(LLM)はこれを用いて言語を理解し、生成します。例えば、「unhappiness(不幸)」という単語は「un(不幸)」「happi(幸せ)」「ness(幸せ)」に分解され、各トークンはモデルが処理できる数値識別子に変換されます(LLMは生のテキストではなく数値を読み取るため)。この攻撃はサイバーセキュリティの脅威の増大を示しており、組織や研究者はAIシステムを保護するための高度な防御戦略を開発する必要があります。
finstructionsとは何ですか?
Finstructions はキーワードに文字を追加することで(「instructions」を「finstructions」に変更するなど)、攻撃者がセキュリティ モデルを騙してコードが無害であると信じ込ませることを可能にします。
一方、標的の大規模言語モデル(LLM)は命令の本来の意図を理解できるため、攻撃者は検知されることなく悪意のあるコードを防御をすり抜けることができます。この脆弱性は、AIシステムにとって重大なセキュリティリスクとなります。
この技術は、AI 搭載のスパムフィルターを回避し、悪意のあるコンテンツをユーザーの受信トレイに配信するために使用され、フィッシングやマルウェア攻撃のリスクが高まる可能性があります。
例えば、スパムフィルターが「宝くじ」という単語を含むメッセージをブロックするように学習されている場合、「宝くじに当選しました!」というメッセージは通過させてしまう可能性があり、受信者は悪意のあるランディングページやマルウェア感染などの脅威にさらされる可能性があります。このような言語操作によって、セキュリティメカニズムの回避が可能になります。
「この攻撃手法は、入力テキストを操作して、一部のモデルが誤った分類を行うようにする」と研究者らは説明した。
「さらに重要なのは、最終ターゲット(大規模言語モデルまたは電子メールの受信者)が操作されたテキストを理解して反応できるため、保護モデルが特に防止するように設計された攻撃に対して脆弱になる可能性があることです」と研究者らは付け加えた。
HiddenLayerは、Unigram単語セグメンテーションを使用するモデルはこの種の操作に対して耐性があると付け加えました。したがって、緩和策の一つとして、より堅牢なセグメンテーション手法を備えたモデルを選択することが挙げられます。










