スタビリティAIによるステーブルオーディオはどのように機能するのでしょうか?

『スタビリティAIによるステーブルオーディオの仕組みとは?』

素晴らしい音楽を生成する新しいAI!

louisbouchard.aiで最初に公開され、2日前に私のブログで読めるようになりました。

ビデオを見る:

AIがすでに素晴らしい音楽を作り出すことを知っていますか?

そうです、そうなんです。研究の文脈では、自分でコーディングすることもできますが、わずかなテキストの説明を入力するだけで音楽のサンプルを手に入れることができるウェブサイトもあります!そして、最高のことは、1か月に最大20回まで無料で試すことができることです!実際に、Stable Diffusionの同じチームが最近リリースした「Stable Audio」があります。Stable Audioは、Stability AIによって非常に似た方法で機能し、テキストを理解し、それらの抽象的な言葉を音楽の表現に変換することができます。まるでイメージのためにStable Diffusionが行うようにです。しかも、無料で使えるだけでなく、彼らは実現方法も公開していますので、さっそく見てみましょう!

私のチャンネルでも何度もご紹介してきたように、特に画像や他の複雑な信号を含む多くの新しい生成アプローチは、拡散ネットワークと呼ばれるアプローチに基づいています。それが、まさにStable Diffusionです。

なぜこれが重要なのか?Stable Diffusionを再び取り上げる理由は2つあります。まず、拡散モデルはノイズを取り入れ、それに基づいて出力を生成する強力なネットワークです。これは、モデルを逆方向に訓練し、画像を開始点にして少しずつ画像を完全にノイズに変換し、それをどのように変換したかをモデルに教えることで実現できます。何百万回もの試行と例を通じて、モデルはノイズのパターンを学び、ノイズをフルに活用して画像のような入力を構築することができます。

イメージからイメージへのスタイル転送アプリケーションの拡散プロセス(スケッチを入力、実際の画像が出力)

しかし、ここには音声について話しているので、これが関連する理由は何でしょうか?実際には、音声は画像と非常に似ています。音声は、周波数コンテンツの時間にわたるすべての視覚的表現であるマグニチュードスペクトログラムに変換することができます。x軸は時間を示しています…

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

機械学習

3つの質問:大規模言語モデルについて、Jacob Andreasに聞く

CSAILの科学者は、最新の機械学習モデルを通じた自然言語処理の研究と、言語が他の種類の人工知能をどのように高めるかの調査...

人工知能

「ElaiのCEO&共同創業者、Vitalii Romanchenkoについてのインタビューシリーズ」

ヴィタリー・ロマンチェンコは、ElaiのCEO兼共同創設者であり、マイク、カメラ、俳優、スタジオの必要なく、個人が一流のビデ...

機械学習

「機械学習 vs AI vs ディープラーニング vs ニューラルネットワーク:違いは何ですか?」

テクノロジーの急速な進化は、ビジネスが効率化のために洗練されたアルゴリズムにますます頼ることで、私たちの日常生活を形...

人工知能

「aiOlaのCEO兼共同創設者、アミール・ハラマティによるインタビューシリーズ」

アミール・ハラマティは、aiOlaのCEO兼共同創業者であり、スピーチを作業可能にし、どこでも完全な正確さで業界固有のプロセ...

人工知能

ギル・ジェロン、Orca SecurityのCEO&共同創設者-インタビューシリーズ

ギル・ゲロンは、オルカ・セキュリティのCEO兼共同設立者ですギルは20年以上にわたりサイバーセキュリティ製品をリードし、提...

AIニュース

Q&A:ブラジルの政治、アマゾンの人権、AIについてのGabriela Sá Pessoaの見解

ブラジルの社会正義のジャーナリストは、MIT国際研究センターのフェローです