jp-jitsumu-whisper-lora

後継版があります: Zoom等の圧縮された実会議音声への頑健性のためベースをwhisper-large-v3-turboに交代し、専門用語recallを54.1%→75.1%に高めた jp-jitsumu-whisper-turbo-lora を公開しました。新規利用はturbo版を推奨します。

日本語音声認識モデル kotoba-whisper-v2.0(Whisper large-v3の日本語蒸留・6.3倍速)を、業務専門用語に強化したLoRAアダプタです。Apple Silicon(MLX)で動作します。

汎用ASRは会計・法務・ITの専門用語で同音異義の漢字選択を誤ります(減価償却費→「原価焼却費」、委任状→「因縁上」、帯域幅→「体域幅」)。この表記選択を、正解既知の合成音声で学習しています。

使い方

pip install 'mlx-tune[audio]'
hf download tokimoa/jp-jitsumu-whisper-lora --local-dir jitsumu-asr
from mlx_tune import FastSTTModel

model, _ = FastSTTModel.from_pretrained("kotoba-tech/kotoba-whisper-v2.0")
model.load_adapter("jitsumu-asr/adapter")
print(model.transcribe("meeting.wav", language="ja"))

認識例(実出力・未見用語)

音声内容 ベース 本アダプタ
委任状でトラブルが発生したため、原因を調査中です。 因縁上でトラブルが… 委任状でトラブルが…
帯域幅の逼迫の取り扱いを確認してください。 体域幅のひっ迫の… 帯域幅の逼迫の…
繰越欠損金を前提に、スケジュールを引き直します。 くりこし欠損金を… 繰越欠損金を…

評価

専門用語(会計・法務・IT)を含む合成音声250文で評価。用語プールは学習と検証でステムレベル分離しており、検証の用語はすべて学習に含まれない未見語です。

モデル 専門用語 表記recall CER
kotoba-whisper-v2.0(ベース) 28.3% 14.3%
whisper-large-v3(蒸留元) 37.3% 9.2%
本アダプタ 54.1% 5.4%

一般的な業務文(336語)は98.2%で、専門用語の強化による回帰はありません。

想定ユースケース

業務の録音をローカルで文字にする場面を想定しています。

  • 会議・打ち合わせ録音の文字起こし。議事録の下書き作成では、抽出モデル jp-minutes-extractor-1.7b と組み合わせると、音声から出席者・決定事項・宿題のJSONまでをローカルで一気通貫できます
  • 経理・法務・IT運用の定例や、監査対応のヒアリング記録など、専門用語の表記精度が成果物の品質に直結する転写
  • 社外に出せない録音の処理。ベース6.3倍速の蒸留モデルなので、16GBのMacでも実時間より十分速く回ります

他形式

whisper.cpp形式(Windows/Linux/mac・大規模GPU不要)は jp-jitsumu-whisper-ggml で配布しています。whisper.cppの既定デコードでは専門用語recall 57.1%(q5_0/f16とも・同一評価セット実測)です。

学習

  • LoRA(rank 8・デコーダのみ)。専門用語の漢字選択はデコーダ側の言語事前分布の問題であるため、エンコーダは凍結
  • データ: 業務専門用語文(会計・法務・IT 98語)の合成音声(Kokoro-82M TTS・話者5種・話速ゆらぎ)5,894文+一般業務文2,499文+Common Voice 26.0日本語(CC0)実音声8,000クリップ
  • TTSの読み誤りによる誤対データは、読み一致フィルタ(形態素解析の読みでCERを取り、表記の同音異義違いは許容)で除去
  • すべてのデータソースは商用利用・ML学習利用が明示的に許可されたもの(Apache-2.0 / CC0)

ライセンス

Apache-2.0(ベースモデルkotoba-whisper-v2.0のライセンスを継承)


Developed by tokimoa

Downloads last month

-

Downloads are not tracked for this model. How to track
MLX
Hardware compatibility
Log In to add your hardware

Quantized

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for tokimoa/jp-jitsumu-whisper-lora

Adapter
(2)
this model
Finetunes
1 model