Whisper-Large-v3-xVITA-zhTW
云碩科技(xCloudinfo)自研繁體中文(台灣華語)語音辨識模型。以 openai/whisper-large-v3 為基座微調,原生輸出繁體中文(台灣用字),不需任何繁簡轉換後處理。
xVITA = Verified Intelligence for Taiwan(可驗證的台灣智慧),為云碩自有模型家族品牌。
線上試用
不用寫程式,開瀏覽器就能測:**xVITA 線上試用 Space**(麥克風錄音或上傳音檔,免費 CPU 推論)。
重點
- 云碩自有料訓練:以云碩自有真實語音語料與自建資料產線為核心訓練而成(詳見「訓練資料」節),資料來源可溯源、品質自主把關——這正是 xVITA 的 V(Verified)。
- 繁體練進權重、雙層保證:base whisper-large-v3 對華語預設吐簡體;本模型以 30 秒滿視窗長段繁體語料訓練,繁體輸出是權重本身的能力——64 秒長音檔裸權重實測零簡體字,不再有 whisper 常見的「長音檔中段滑回簡體」現象。另在
generation_config.json內建純簡體詞元封鎖清單當第二道保險(transformers 載入即生效)。 - 自動標點:長段訓練讓模型自帶句讀(句號斷句),逐字稿可讀性大幅提升——base 與多數微調版皆為無標點長串。
- 內容準度不犧牲:同一測試集上內容層準度優於 base。
- 無生成退化:微調後無 whisper 常見的重複迴圈/跑長問題,推論耗時與 base 相當。
- 同時提供 HF Transformers 格式與 CTranslate2 格式(
ct2/目錄,faster-whisper 直接載入)。
評測(962 句台灣華語固定測試集,字元錯誤率 CER)
| 模型 | 內容 CER(繁簡統一後) | 實際輸出 CER(vs 繁體標準答案) |
|---|---|---|
| openai/whisper-large-v3(base) | 5.94% | 33.26%(輸出為簡體) |
| Whisper-Large-v3-xVITA-zhTW | 5.57% | 8.60%(原生繁體) |
正規化:僅比對 CJK 字元、阿拉伯數字轉中文數字後計算。
使用
Transformers
from transformers import pipeline
pipe = pipeline("automatic-speech-recognition",
model="xCloudinfo/Whisper-Large-v3-xVITA-zhTW",
device=0)
out = pipe("audio.wav", generate_kwargs={"language": "zh", "task": "transcribe"})
print(out["text"]) # 繁體中文
faster-whisper(CTranslate2)
from faster_whisper import WhisperModel
model = WhisperModel("xCloudinfo/Whisper-Large-v3-xVITA-zhTW",
device="cuda", compute_type="float16")
# 或下載後指向 ct2/ 子目錄
segments, info = model.transcribe("audio.wav", language="zh", beam_size=5)
text = "".join(s.text for s in segments)
# 長音檔建議加這行保險層(台灣正體 s2tw,非 s2t):
from opencc import OpenCC
print(OpenCC("s2tw").convert(text))
whisper.cpp(GGML/GGUF,CPU 或邊緣裝置)
gguf/ 目錄提供三個量化等級:
| 檔案 | 大小 | 適用 |
|---|---|---|
ggml-xvita-zhtw-q5_0.bin |
1.1 GB | 邊緣裝置、記憶體受限環境 |
ggml-xvita-zhtw-q8_0.bin |
1.7 GB | 品質與大小平衡 |
ggml-xvita-zhtw-f16.bin |
3.1 GB | 最高品質 |
./build/bin/whisper-cli -m ggml-xvita-zhtw-q5_0.bin -l zh -f audio.wav
訓練資料:云碩自有語料與自建資料產線
本模型的核心價值在於云碩自有、自產、可溯源的台灣華語語料,非直接取用網路現成資料集訓練:
- 云碩自有真實語音語料:取自云碩實際營運場景(真實會議錄音)的第一手語音與逐字稿切段,經授權收集、去識別化後投入訓練。此類資料為市面模型(含基座)從未見過的獨家語料,是本模型貼合台灣真實口語場景的關鍵。
- 云碩自建資料產線全程把關:所有語料(含輔助用的公開語料 zh-TW 篩選子集)皆經云碩自有資料產線處理——locale 逐筆過濾(僅保留台灣華語、完整排除非台灣腔別與非台灣用字語料)、逐字稿正規化、繁體台灣用字驗證、去識別化——最終合計約 9.3 萬筆純台灣華語訓練樣本(含云碩長段語料工程:將語料組合為 30 秒滿視窗長段,訓出長音檔繁體穩定性與自動句讀)。資料的篩選規則、品質閘門與版本皆由云碩自主控制、可溯源、可重現。
- 自有算力訓練:於云碩自有 AI 算力資源池完成訓練、評測與發佈,全程不出企業環境。
訓練方法
- 基座:openai/whisper-large-v3(MIT)
- 方法:云碩自研微調食譜。whisper 系列微調極易出現災難性遺忘與生成退化(重複迴圈、跑長)——市面上多數微調版都倒在這裡;本模型以云碩內部的訓練控制與獨立域外驗證流程完成,確保在取得原生繁體輸出與內容準度增益的同時,基座的泛化能力完整保留(962 句域外測試集實測:推論耗時 750s,較 base 的 835s 更短,無任何生成退化;64 秒長音檔裸權重輸出零簡體)。具體訓練配方為云碩技術資產,不對外揭露。
授權
- 本模型權重:Apache-2.0
- 基座 openai/whisper-large-v3:MIT
- 與 TAIDE 無關:未使用 TAIDE 模型或 TAIDE 授權語料。
關於云碩
云碩科技股份有限公司(xCloudinfo Corp. Limited)專注於私有化 AI 解決方案:地端大型語言模型微調與蒸餾、繁體中文語音辨識、文件辨識與企業知識檢索。
- Downloads last month
- 240
Model tree for xCloudinfo/Whisper-Large-v3-xVITA-zhTW
Base model
openai/whisper-large-v3