ビデオベースがますます進む世界では、ビデオ作成および編集ツールの重要性が増しています。ただし、ビデオ編集プロセスは依然として複雑で、特に初心者にとっては時間がかかります。
AI 開発のスピードが人間の理解を超えたところに向かう中、テキスト プロンプトをビデオに変換する OpenAI の Sora はまさに最新の AI テクノロジーであり、誰もが予想していたよりも早く物事が起こっていることに世界に衝撃を与えています。
OpenAI Sora は、効率的かつ革新的な方法でビデオを変換および編集することを目的とした革新的なテクノロジーです。このモデルは、ビデオ業界に与える影響の範囲について疑問を投げかけていますが、ビデオの制作と編集の方法を永遠に変えることに貢献するのでしょうか?この記事では、OpenAI Sora のコンセプトとその潜在的な機能を探り、それがビデオ業界にどのような影響を与えるか、そしてこのイノベーションがユーザーとクリエイターの両方にとって何を意味するのかを見ていきます。確認する 最高の AI ビデオ ジェネレーター (テキストからビデオへ).

クイックリンク
OpenAI Sora とは何ですか?
DALL-E や MidJourney などの他の生成 AI モデルと同様に、Sora はユーザーからテキスト プロンプトを受け取り、それを視覚的なメディアに変換します。ただし、上記の AI を活用した画像ジェネレーターとは異なり、Sora は、動き、さまざまなカメラ アングル、方向など、従来のビデオに期待されるすべてのものに満ちたビデオを作成します。

の例を見ると、 ソラのウェブサイト、結果は多くの場合、プロが制作した本物のビデオと区別がつきません。ハイエンドのドローン撮影から、俳優が出演する数百万ドル規模の本格的な映画制作まで、人工知能、特殊効果、作品によって作成されたものまで、すべてが含まれます。

もちろん、Sora がこれを実現する最初のテクノロジーではありません。これまでのところ、この分野で最も目立つリーダーは次のとおりです。 滑走路ML、サービスを有料で一般に提供します。ただし、最良の状況下であっても、Runway のビデオは、最初の世代に近いです。 ミッドジャーニーの静止画。画像安定化機能はなく、物理学は意味がありません。この記事を書いている時点では、最長のクリップは約 16 秒です。
対照的に、Sora が提供できる最大の価値は完全な安定性であり、(少なくとも私たちの脳にとっては) 物理学が正しく感じられ、クリップの長さは最大 1 分にもなります。クリップには完全に音声がありませんが、他の AI システムもすでに存在しています。 音楽を生成する 効果音と音声。したがって、これらのツールを Sora のワークフロー、あるいは最悪の場合でも従来のナレーションやフォーリー作業に統合できることに私は何の疑いもありません。確認する 最も興味深くて楽しい AI ツールをチェックしてください.
Sora デモのわずか 1 年前の悪夢のような AI ビデオ映像から見ると、Sora がどれほど大きな飛躍を遂げたかは、どれだけ強調してもしすぎることはありません。非常に不穏な AI ビデオのように、 スパゲッティを食べるウィル・スミス。これは、AI 画像ジェネレーターがジョークからビジュアル アーティストの心に実存的な恐怖を与えるようになったときよりも、システムにとって大きな衝撃だと思います。
Sora は、単発のクリエイターからディズニーやマーベルの巨額予算プロジェクトのレベルに至るまで、ビデオ業界全体に影響を与える可能性があります。これでは何も生き残れません。 Sora は生地全体から何かを作成する必要がなく、提供された静止画像をアニメーション化するなど、既存の素材を使用して作業できるため、これは特に当てはまると思います。これが AI 映画制作の本当の始まりとなるかもしれません。
ソラはどのように機能しますか?
ソラのキャラクターについてはできる限り掘り下げていきますが、そこまで詳しくは説明できません。まず、OpenAI は皮肉なことに、そのテクノロジーの内部動作についてオープンではありません。それは独自のものであるため、Sora を競合他社と区別する秘密のソースの詳細は不明です。第二に、私はコンピューター科学者ではありませんし、おそらくあなたもコンピューター科学者ではないので、私たちはこのテクノロジーがどのように機能するかを大まかで一般的な観点からしか理解できません。
良いニュースは、Sora (サブスクリプション保護) の優れたウォークスルーがあるということです。 マイク・ヤング 中程度、に基づいて OpenAIからの技術レポート 私たち一般人でも理解できるように詳しく書かれています。どちらの文書も読む価値がありますが、最も重要な事実をここで抽出できます。
Sora は、ChatGPT や DALL-E などのモデルを作成するときに OpenAI が学んだ教訓に基づいて構築されています。 OpenAI は、サンプル ビデオを ChatGPT トレーニング モデルで使用される「トークン」に似た「パッチ」に分割することで、サンプル ビデオで Sora をトレーニングする方法を発明しました。これらのトークンはすべて同じサイズであるため、クリップの長さ、アスペクト比、解像度サイズなどは Sora にとっては関係ありません。
Sora は、GPT を強化するのと同じ広範なトランスフォーマー アプローチと、AI 画像ジェネレーターで使用される伝播方法を組み合わせて使用します。トレーニング中に、ビデオから部分的に伝播されたパッチ トークンを調べ、ノイズのないトークンがどのように見えるかを予測しようとします。これをグラウンド トゥルースと比較することで、モデルはビデオの「言語」を学習します。これが、からの例が挙げられる理由です。 ソラのウェブサイト とてもオリジナルに見えます。
この素晴らしい能力に加えて、ソラには、トレーニングされたビデオ フレームに対する非常に詳細な組み込みの注釈も備わっています。これが、彼がテキスト プロンプトに基づいて作成したビデオを編集できる理由の大きな部分を占めています。
ビデオ内の物理を正確にシミュレートするソラの能力は、新たな機能であるようですが、これは単純に、現実世界の物理に基づいたモーションを含む何百万ものビデオでのトレーニングの結果です。 Sora はオブジェクトの安定性に優れているため、オブジェクトがフレームから離れたり、フレーム内で他のものに妨げられたりした場合でも、オブジェクトはそこに留まり、何の混乱もなく戻ってきます。
ただし、ビデオ内のオブジェクトが因果関係やオブジェクトの自動作成と相互作用する場合には、依然として問題が発生することがあります。また、少し面白いことに、ソラは時々左右を間違えるようです。しかし、これまで実証されてきたものは、実際に使えるだけでなく、確かに最先端の技術です。
ソラはいつアクセスできますか?
ですから、私たちは皆、Sora をテストすることに非常に興奮しています。そして、それが正確な結果を示さない場合でも、私がそれを使用して、このテクノロジーがどれほど優れているかについて正確に書くことは保証できますが、結果が得られる可能性がある場合は、それは起こりますか?
この記事の執筆時点では、Sora が一般の人々に利用可能になるまでにどれくらい時間がかかるか、またアクセスにどれくらいの費用がかかるかは明確ではありません。 OpenAIによると、このモデルは「レッドチーム」の手に渡っているという。このチームは、ソラにやってはいけないあらゆる邪悪な行為をさせ、それに対するガードレールを設置するのを手伝うことを仕事としている人々のグループだ。実際の顧客がそれを使用できるようになると、問題が起こります。これには、誤解を招く情報の作成、攻撃的または攻撃的な素材の作成、および想像できるその他の多くの違反の可能性が含まれます。
この記事の執筆時点では、これは選ばれたコンテンツ作成者の手に渡っていますが、これはテスト目的であり、最終リリースに向けての途中で第三者のレビューと承認を得るためにあると思います。
肝心なのは、DALL-E 3 を使用するために料金を支払うのと同じように、実際にいつ利用可能になるかはわかりません。実際、OpenAI ですら正確な日付はまだわかっていません。これは単純に、安全性試験担当者の手に渡った場合、修正に予想以上に時間がかかる問題が発見され、一般公開が遅れる可能性があるためです。
OpenAI が Sora を誇示する用意ができていると感じているという事実、さらには検出された安全性を通じて何らかの調整された公的主張を行う準備ができていると感じているという事実は、誰も確かなことは言えません。数年ではなく数か月の話をしていると思いますが、来週はそれを期待しないでください。閲覧できるようになりました アーティストとクリエイターのための倫理的な AI ツール.









