AI・機械学習
Show HN: Nari Qwen3-TTSとQwen3-ASR – 高精度、低遅延、低コスト
Show HN: Nari Qwen3-TTS and Qwen3-ASR – High accuracy, low latency and cost (narilabs.com)
要約
Nari Labsは、オープンソースの音声モデル(Qwen3-TTSおよびQwen3-ASR)向けに、低遅延かつ低コストで高精度な推論エンジンを開発しました。このエンジンは、Coval音声AIベンチマークにおいて、多くのクローズドソースモデルを凌駕する性能を示し、音声技術のコモディティ化を目指しています。
全文翻訳
皆さん、Nari LabsのTobyです。
私たちはOSSの音声モデルを非常に高速化することに取り組んできました。昨年、自然な対話が可能な初のOSSテキスト読み上げモデルであるDiaを開発しました。それ以来、さらに多くの優れた音声モデルが公開されています。
しかし、市場は依然としてクローズドソースモデルに支配されています。私たちは、これが推論の問題だと考えています。vLLMやSGLangのような既存のシステムは、マルチモーダル推論にはあまり適していません。これを証明するために、Qwen3-TTSに特化した推論エンジンを構築し、オープンソース化しました(https://github.com/nari-labs/nari-qwen3-tts)。10 RPSで50ミリ秒未満の遅延で動作し、オープンモデルがより高速かつ安価に実行できることを示しました。
それ以来、私たちはすべての人に安価で高速、高品質なサービングを提供するために懸命に努力してきました。そして、私たちはクローズドモデルがゲームで勝つことさえ打ち破りました!
高く引用されているCoval(YC S24)音声AIベンチマークで測定した結果、当社のQwen3-TTSエンドポイントは、遅延で2位であるだけでなく、11LabsやCartesiaなどと比較して精度(WER)で1位であり、かつ最も安価なエンドポイントです。当社のQwen3-ASRエンドポイントは、最も低い遅延と2位の精度を持ち、1位からわずか0.1%差です。リストの中で2番目に安価なモデルです。
これらのモデルを高速に、高性能に、そして低コストに保つためには、多くの巧妙な推論エンジニアリングが必要でした。興味深いことに、Alibabaの公式エンドポイントは、当社のものと比較して精度と遅延の点で劣っているようです。しかし、それでも、これらの素晴らしい音声モデルをOSS化してくれたQwenチームには多大な感謝を捧げます。
私たちは、音声技術をコモディティ化するために、価格をさらに引き下げ続けたいと考えています。これにより、すべてのアプリがユニットコストを気にすることなく、優れたTTSとSTTを利用できるようになります。また、話者分離などのオーディオの他の部分や、ビデオ、ワールドモデルの推論にも取り組んでいます。今後もさらに多くの発表があります!