AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

Hugging Face、TTSモデルの客観的評価基盤「Open TTS Leaderboard」の仕組みを公式ブログで解説

30秒サマリー

  • Hugging Face HubのTTSモデルは8,000件超に達するが、評価手法の標準化が追いついていない課題がある
  • 新リーダーボードは人手投票不要の客観指標(WER・速度・話者類似度)で数時間以内に評価を完了できる
  • 多言語・音声クローニング・ストリーミング性能も比較可能で、オープンソースモデルの可視化を重点化

何が起きたか

Hugging Face は2026年9月30日付の公式ブログで「Open TTS Leaderboard」の構成と評価手法を詳しく解説した。同ブログによると、Hugging Face Hub上のTTSモデルは同日時点で8,000件を超えているが、従来のアリーナ形式評価(人間の投票によるEloスコア算出)は新モデルの公開ペースに追いつかず、数週間を要する点が課題とされていた。また、既存のArtificial Analysis(92モデル中オープンウェイトは16件)やVoice Arenaでもオープンソースモデルが過小代表になっている実態が示されている。

Open TTS Leaderboardは、この課題に対し三つの客観指標で評価を行う。(1)「知性度」:Qwen3 ASRを用いた単語・文字誤り率(WER/CER)、(2)「速度」:H200 GPU上での推論スループット(RTFx)およびストリーミング初音到達時間(TTFA)、(3)「話者類似度」:WavLMスピーカー埋め込みのコサイン類似度。これらにより評価時間は数時間程度に短縮できるとしている。

対応スコープは英語・中国語・日本語・韓国語を含む多言語と、音声クローニング機能の有無別比較。英語WERの上位にはhexgrad/Kokoro-82M、Supertone/supertonic-3、fishaudio/s2-proが挙げられており、多言語では k2-fsa/OmniVoice、fishaudio/s2-pro、FunAudioLLM/Fun-CosyVoice3-0.5B-2512 が強いとされている。「Listen」タブでは実際の生成音声を試聴・比較・投票でき、「Streaming」タブではTTFAを基にリアルタイム用途向けの性能比較が可能。CPU上でも一部モデルの結果が提供されており、kyutai/pocket-ttsがGPU・CPU双方で優れた結果を示している。

ブログでは、本リーダーボードは人間の選好評価を「置き換えるものではない」と明記しており、自然さや表現力の測定には限界があることも認めている。評価スクリプトは近くオープンソース化される予定であることも示されている。

原典ハイライト

「アリーナ形式では数週間かかる評価が客観指標なら数時間で完了する。ただし自然さや表現力は測定できず、人間の選好評価を代替するものではない」とブログは明示。オープンウェイトモデルがアリーナで過小評価される構造的要因(ホスティングコスト・API追加の容易さの差)も指摘している。

出典: Hugging Face Blog(公式ブログ)

So What?(なぜ重要か)

TTS市場でのモデル選定において、人手評価に頼らず客観スコアで素早く候補を絞り込める参照点が整備されつつある。特に多言語・音声クローニング・低遅延ストリーミングという実用上の軸で比較できる点は、音声AIを業務適用する際の検討コストを下げる可能性がある。一方でリーダーボードが「自然さ」を測れないことは引き続き留意が必要であり、最終的な採用判断には人間による試聴評価との併用が求められる。

日本企業への示唆

音声AIを顧客対応・ナレーション・音声エージェントなどに導入検討している日本企業にとって、日本語・韓国語・中国語を含む多言語WERや話者類似度を客観的に比較できる本リーダーボードは、PoC前のモデル候補絞り込みに活用できる。ただし、業務用途では自然さや感情表現の適切さが重要になるケースが多く、リーダーボードスコアだけで採用を決めず、実業務データでの試聴・社内評価と組み合わせる運用が望ましい。また、評価スクリプトのオープンソース化が予告されており、社内の特定言語・ドメインに合わせた独自評価パイプラインを構築する際の出発点としても活用余地がある。

背景・経緯

Hugging Face Hub上のTTSモデル数は2026年9月30日時点で8,000件超に増加している。既存のアリーナ型リーダーボード(TTS Arena v2、Artificial Analysis、Voice Arena)はEloスコアを人間投票で算出する仕組みのため、急増するオープンソースモデルの評価に数週間を要し追いつけない状況が続いていた。同社はオープンソースASRモデルの評価基盤「Open ASR Leaderboard」も別途運営しており、今回のTTSリーダーボードはその知見を踏まえたものとみられる。