AI・機械学習
Ask HN: テキストと参照に基づいて音声を生成するAIモデルはありますか?
Ask HN: Are there AI models for generating sounds based on a text and reference?
要約
ユーザーは、参照音声とテキスト指示を入力して別の音声を生成できる商用AIモデルを見つけるのに苦労している。画像生成ではテキストと参照画像による多モーダル入力が一般的だが、音声生成ではテキストと音声入力から音声を出力する「Audio + text -> Audio」のワークフローがまだ確立されていない。ElevenLabs SFXやStable Audio 3のようなモデルも、参照なしでは精度が低いか、期待通りの結果が得られないという。
全文翻訳
解決策を見つけるのに苦労しています。参照音とテキスト指示を与えて別の音を得ることができる商業化されたモデルは本当にないのでしょうか?
現在、画像またはテキスト出力へのマルチモーダル入力はコモディティ化され、解決された問題です。つまり、画像に対するプロンプトを入力し、参照画像を使用してモデルをガイドすることができます。結局のところ、絵は千の言葉に値するということわざがありますよね?
また、テキストと音声入力を利用して、テキストの説明や分類を得ることもできました。
どうしても、Audio + text -> Audioの解決策が見つかりません。
私のユースケースは、クリーンな例があまりないソースに基づいて新しい効果音を生成しようとしているのですが、これは単なる解決済みのワークフローだと思っていました。しかし、あまり見つかりません。ElevenLabs SFXを試しましたが、それはテキスト->オーディオのみであり、参照がないと、テキストだけでガイドして正確に音を再現するのは困難です。私が期待していることを行うはずのStable Audio 3モデルを試しましたが、結果はひどいものでした。このモダリティは、画像生成が2016年頃にあった状態に留まっているようです。他に何かありますか、それともこれは一般的なニーズではないのでしょうか?