【朗報】早耳さん、GPUもクラウドも使わず字幕を出してしまうwww

【朗報】早耳さん、GPUもクラウドも使わず字幕を出してしまうwww 時事
新着の記事
PR
1: ひえコペ

■3行でわかる

  • CPUのみで動作し、メモリ2GB未満でも使える
  • 発話中に字幕を更新し、日本語は約100msで確定
  • 話者ラベル付けや翻訳字幕にも対応

■Hayamimi(早耳)とは?CPUだけで字幕を生成

Hayamimi(早耳)は、GPUやクラウドAPIを使わずに動作するリアルタイム多言語音声認識システムだ。メモリ2GB未満の環境でも使え、音声をライブ字幕として表示するほか、話者ラベル付けや翻訳字幕の生成にも対応する。発話の途中から字幕が出始め、日本語では話し終えて約100ミリ秒で確定文を出力する。軽量さと反応速度を両立させた設計が特徴となっている。

■発話ごとに言語を判定して専用モデルへ振り分け

従来のCPUベースの音声認識では単一モデルに頼る方式が多いが、Hayamimiは発話ごとに言語を判定し、言語に合ったモデルへ処理を振り分ける。日本語・中国語・韓国語・広東語・英語に加え、欧州の24言語には専用モデルを用意し、それ以外の約1600言語はMeta Omnilingual ASRに切り替える。

■ONNXと量子化でCPU処理を軽量化

モデルはINT8量子化されたONNX形式で、sherpa-onnx上で動作する。PyTorchやCUDAを必要とせず、6コアのデスクトップCPUでは実時間の10~50倍の速度を実現したという。

■ドラフト字幕から清書まで段階的に処理

発話中は約0.5秒ごとにドラフト字幕を更新し、文が終わると短時間で確定させる。さらに2秒間の無音が続くと直前の音声を再処理し、清書トランスクリプトを作る仕組みだ。日本語の文字誤り率は、この二段階処理によって15.5%から12.0%に改善した。

■話者ラベルと翻訳字幕もオプションで追加

「–speakers」オプションを使うと、CAM++によるリアルタイムの話者タグ付けが可能になる。清書処理ではpyannote/segmentation-3.0による話者の再分離も行う。「–translate」オプションでは翻訳字幕を生成できる。

■テレビ放送の日本語音声でCER3.8%

実際のテレビ放送の日本語音声を使った結果では、文字誤り率(CER)が3.8%だった。軽量動作と認識精度の両方を掲げるシステムで、用途に応じてリアルタイム字幕や清書文を使い分けられる。

■よくある疑問

Q. Hayamimiの動作にGPUは必要?

A. GPUやクラウドAPIに依存せず、CPUのみで動作する。メモリ2GB未満の環境にも対応する。

Q. どの言語の音声を認識できる?

A. 日本語・中国語・韓国語・広東語・英語のほか、欧州24言語に専用モデルがある。それ以外の約1600言語はMeta Omnilingual ASRで処理する。

■まとめ

Hayamimiは、CPUだけで多言語のライブ字幕や話者ラベル、翻訳字幕まで扱う軽量音声認識システムだ。

ひえコペ

Hayamimiの売りは認識精度ではなく、間違いを後段で回収する設計だ。発話中は約0.5秒ごとにドラフトを出し、日本語は終了後約100ミリ秒で確定、さらに2秒の無音後に再処理する。実際、この二段階処理で日本語の文字誤り率は15.5%から12.0%へ下がっている。速報字幕と清書を分ける発想が精度向上の土台だが、ライブ表示だけの評価とは分けて語るべきだ。速さの看板より、訂正の段取りを売れ。

2: ひえコペ

早耳さん、耳だけ先に字幕会議へ出席してるんか。発話途中から字幕が出るとか、耳のフライングで草。

3: ひえコペ

メモリ2GB未満でも動くのに、ワイの脳内キャッシュは単語ひとつで溢れるんやが。

4: ひえコペ

ドラフトから清書って、夏休みの宿題の最終日に発動する二段階処理ンゴ。

5: ひえコペ

約1600言語まで対応なら、そのうち世界中の会議の沈黙まで字幕化する時代が来るやろ。

コメント一覧

タイトルとURLをコピーしました