Gemini 1.5 の XNUMX 万トークン コンテキスト ウィンドウがゲームチェンジャーである理由

自然言語処理 (NLP) の分野は、人間の言語を理解して処理する優れた能力を提供する大規模言語モデル (LLM) の出現により、近年大きな革命を目の当たりにしました。 Gemini 1.5 はこれらのモデルの最新の 1.5 つであり、状況に応じて膨大な可能性を提供します。 Google Gemini XNUMX モデルには、XNUMX 万個のユニークなアイコンからなる大規模なコンテキスト ウィンドウが付属しており、ChatGPT、Claude、その他の AI 搭載チャットボットなどの直接の競合製品を小さくしています。

Gemini 1.5 の XNUMX 万トークンのコンテキスト ウィンドウは革新的なもので、モデルが言語をより深く正確に理解できるようになります。コンテキスト能力が向上すると、モデルは特定の単語や文の周囲のより多くの単語やフレーズを分析できるようになり、意味をより適切に推測できるようになります。確認する GoogleのGemini AIが登場:AIの世界でChatGPTよりも目立つのか?

コンテキストウィンドウとは何ですか?

概念の説明や文章の要約など、クエリに応答する際、AI モデルが応答を生成するために考慮できるデータの量には制限があります。考慮できる最大のテキスト サイズはコンテキスト ウィンドウと呼ばれます。

この概念を別の方法で見ることができます。食料品リストを持たずに、野菜や家庭用品を買いに食料品店に行ったとします。買い物の際に記憶できる食料品の最大数は、コンテキスト ウィンドウです。覚えている食料品が多ければ多いほど、指定された買い物計画を台無しにしない可能性が高くなります。同様に、AI モデルのコンテキスト ウィンドウが大きいほど、最良の結果を提供するために必要なすべてをモデルが記憶する可能性が高くなります。

この記事の執筆時点では、Anthropic の Claude 2.1 コンテキスト ウィンドウ (200 トークン) は、公開されている AI モデルの中で最大のコンテキスト ウィンドウです。続いて、4 トークンのコンテキスト ウィンドウを備えた GPT-128 Turbo が続きます。 Google Gemini 1.5 は、市場にある他のウィンドウよりも XNUMX 倍大きい XNUMX 万個のコンテキスト ウィンドウを提供します。これは大きな疑問につながります。XNUMX 万個の異なるアイコンが表示されるコンテキスト ウィンドウの中で何が特別なのでしょうか?確認する ChatGPT トークンの制限はいくらですか? それを超えることはできますか?

Gemini 1.5 のコンテキスト ウィンドウがこれほど重要なのはなぜですか?

より詳しく言うと、Claude AI の 200 コンテキスト ウィンドウは、約 150 語の本を取り込み、それに対する回答を提供できることを意味します。これは本当に巨大です。しかし、Google Gemini 1.5 は一度に 700000 語を収容できるようになります。

ChatGPT や Gemini などの AI チャットボットのプロンプトに大きなテキスト ブロックを入力すると、AI チャットボットはできるだけ多くのテキストを取り込もうとしますが、取り込める量はコンテキスト ウィンドウによって異なります。したがって、100 単語しか処理できないモデルで 28 単語の会話を行った後、そのモデルに 100 単語の会話全体を完全に理解する必要がある質問をし始めると、モデルは失敗することになります。 。

20 時間の映画のうち XNUMX 分だけを観ているのに、映画全体の説明を求められることを想像してみてください。どれくらい良い結果が得られるでしょうか?回答を拒否するか、単に話をでっち上げます。まさに AI チャットボットが行うことです。その結果、... 人工知能の幻覚.

さて、チャットボットに 100 語を入力する必要がなかったと思っているとしても、重要なのはそれだけではありません。コンテキスト ウィンドウは、たった XNUMX つのプロンプトで AI モデルに供給されるテキストを超えています。 AI モデルは、チャット セッション中の会話全体を考慮して、応答が可能な限り関連性のあるものになるようにします。

したがって、モデルに 100 語の本を与えていなくても、往復の会話とそれが与える応答はすべてコンテキスト ウィンドウの計算に加算されます。 Google の ChatGPT や Gemini が、会話の前半であなたが言ったことをなぜ忘れ続けるのか不思議に思いませんか?彼はコンテキスト ウィンドウのスペースを使い果たし、物事を忘れ始めたのかもしれません。

コンテキスト ウィンドウが大きいことは、長い記事の要約、複雑な質問への回答、生成されたテキストの一貫した説明の維持など、コンテキストを深く理解する必要があるタスクで特に重要です。全体を通して一貫した物語を持つ 50 語の小説を書きたいですか? XNUMX 時間のビデオを「見て」質問に答えることができるモデルが欲しいですか?より大きなコンテキスト ウィンドウが必要です。

つまり、Gemini 1.5 のコンテキスト ウィンドウの拡大により、AI モデルのパフォーマンスが大幅に向上し、幻覚が減少し、精度と指示に従う能力が劇的に向上する可能性があります。

Gemini 1.5 は期待に応えられるでしょうか?

すべてが計画通りに進めば、Gemini 1.5 は市場で最高の AI モデルを上回るパフォーマンスを発揮する可能性があります。ただし、Google が安定した AI モデルの構築に何度も失敗していることを考えると、慎重になることが重要です。フォームのコンテキスト ウィンドウを開くだけでは、フォームは自動的に改善されません。

私は 2.1k Claude 200 コンテキスト ウィンドウをリリース以来数か月間使用してきましたが、XNUMX つのことが明確でした。それは、コンテキスト ウィンドウを大きくするとコンテキストの感度が実際に向上しますが、基礎となるモデルのパフォーマンスに問題があるため、コンテキストが大きくなる可能性があるということです。それには問題がある。

Google Gemini 1.5 はゲームチェンジャーとなるでしょうか?ソーシャル メディアは現在、早期アクセス ユーザーからの Gemini 1.5 に対する熱烈なレビューで溢れています。ただし、1.5 つ星のレビューのほとんどは、急いでいる、または単純化した使用例に基づいています。 Gemini XNUMX が実際にどのように動作するかを確認するには、次の技術レポートを参照してください。 Google ジェミニ 1.5 [PDF]。レポートは、「制御されたテスト」中であっても、モデルがコンテキスト ウィンドウのサイズ内でドキュメントの詳細をすべて取得できなかったことを示しています。

100 万トークンのコンテキスト ウィンドウはすでに素晴らしい技術的成果ですが、ドキュメントの詳細を確実に取得する機能がなければ、より大きなコンテキスト ウィンドウは実用的な価値がほとんどなく、精度の低下や追加の幻覚の原因になる可能性があります。閲覧できるようになりました ChatGPT を超えて: チャットボットと生成 AI の将来のビジョン?

トップボタンに移動