TTS 只剩 37MB,Inflect 連自己輸的那欄都印出來
他為什麼要印自己輸的那一欄?
模型卡拉到第四節,有一張六列的速度表。第一名是 Piper Low,31.37 倍即時;接著 KittenTTS Nano 13.33 倍、Inflect-Nano-v2 10.72 倍、Supertonic 3 的三步模式 10.15 倍。
Inflect-Micro-v2 排第五,6.28 倍。這張排行表,就印在它自己的模型卡上。
放這張表的人叫 Owen Song,他在 2026 年 7 月 26 日於 Hugging Face 放出 Inflect-Micro-v2——9,356,513 個可部署參數、FP32 權重 37.53 MB、24 kHz 單聲道輸出、Apache-2.0 授權,一顆完整跑在自己電腦上的英文語音合成模型。同一天這則貼文進了 Hacker News 首頁,185 分。他在模型卡開頭寫,這個專案是他獨立做、獨立出資的,如果真的有人在用,他想繼續做涵蓋更多語言和聲音的 v3。
表格下面還有一段話。他寫明這張表本來就不對等:Inflect 這兩列跑的是 100 題的穩態測試,其他系統跑的是 50 題的確認測試;而且好幾個對照組用的是優化過的 ONNX 執行環境,他自己這兩個數字跑的是原生 PyTorch。
整張表長這樣:
| 名次 | 系統 | 音訊長度 ÷ 實際耗時 |
|---|---|---|
| 1 | Piper Low | 31.37× |
| 2 | KittenTTS Nano | 13.33× |
| 3 | Inflect-Nano-v2 | 10.72× |
| 4 | Supertonic 3(三步) | 10.15× |
| 5 | Inflect-Micro-v2 | 6.28× |
| 6 | Supertonic 3(八步) | 4.37× |
37MB 裝得下整條路,聲碼器也包在裡面
先把規格講清楚,這樣你才知道 6.28 倍是快是慢。
這顆模型是 VITS 家族的端到端文字轉波形生成器:英文音素前端、單調對齊、隨機潛在合成、殘差耦合流,最後那顆神經聲碼器整合在同一份權重裡。你不需要另外掛一個 vocoder,也不需要在推論時載入任何外部模型或參考音檔。
37.53 MB 是這一整條路徑加起來的大小。6.28 倍即時的意思是,在 Hugging Face 的 8 vCPU 機器上開四個執行緒,跑一分鐘的語音大約花你十秒。它在那張表上排倒數第二,但仍然比即時快六倍有餘——生成永遠追得上播放。
模型卡的標題寫 complete voice。討論串當天就有人跳出來澄清這個字:它指的是文字到波形的完整路徑,不含語音辨識。你拿它做不出語音助理的耳朵,只做得出嘴巴。
官方另外釋出了 ONNX 版本,把模型拆成 duration.onnx 和 decode.onnx 兩張圖,支援 CPU、CUDA 和 DirectML,整條路不需要匯入 PyTorch。討論串裡當天就有人拿它做了在瀏覽器裡直接跑的展示頁,也有人把它接進 Linux 的 speech-dispatcher 當系統朗讀。這兩個都是社群作品,不是官方支援。
三顆能離線跑的選項,中文只有一顆有
限制段落寫在賣點旁邊,四句話:英文限定、只有一個固定男聲、零樣本聲音複製做不到、新聲音與新語言「目前未驗證也不支援」。第四句還補了一刀——換一個新聲音的做法是把原本那個換掉,你手上永遠只有一個聲音可用。
對做繁中產品的人來說,這四句話等於直接關門。所以先把離線這條路上真正能挑的東西並排:
| Inflect-Micro-v2 | Inflect-Nano-v2 | Kokoro-82M | |
|---|---|---|---|
| 參數 | 9,356,513 | 3,966,721 | 82M(官方標示) |
| FP32 權重 | 37.53 MB | 15.97 MB | 官方未標示 |
| 授權 | Apache-2.0 | Apache-2.0 | Apache-2.0 |
| 語言 | 英文 | 英文 | 8 語系 |
| 聲音 | 1 個固定男聲 | 1 個固定男聲 | 54 個 |
| 有華語嗎 | 沒有 | 沒有 | 有,4 女 4 男 |
要中文,路在最右邊那欄。Kokoro-82M 同樣是 Apache-2.0,官方的 VOICES.md 列了 8 個語系共 54 個聲音,華語有 4 女 4 男。但同一份文件也自己標了但書:非英語的支援「可能缺席或很薄」,原因是字音轉換品質與訓練資料量。挑的時候把這句一起帶著。
66.2% 這個數字的分母是 34 場
模型卡頭條那一列有五個數字:社群盲測偏好率 66.2%、UTMOS22 分數 4.395、兩家語音辨識器的語意錯字率 3.99%、權重 37.53 MB、CPU 6.28 倍即時。它們各自獨立列出,沒有被壓成一個總分。
66.2% 這格點開來,是 21 勝、10 敗、3 平,平手算半勝——總共 34 場。作者自己在下面寫,這是描述性的社群證據,不是正式的 MOS 聽測。同一段也標明 UTMOS22 是一個學習出來的預測器,不等於人類評分;95% 的自助抽樣信賴區間落在 4.381 到 4.408。
所以這顆模型好不好聽,這份文件沒有給你答案,它給的是一組你可以自己去戳的數字。討論串裡的評價也確實分岔:有人說品質跟歷史上那些 TTS 工具差不多,跟 macOS 內建的 Samantha 比只是「marginally better」;也有人直接反駁,說比十年前任何東西都好聽。我們沒有播放過任何一段樣本,這裡只轉述。
語音辨識器那格更有意思。頭條分數只採兩家(Qwen3-ASR 與 Nemotron 3.5),Whisper 被排除,理由寫在旁邊:它在部分 Supertonic 八步模式的音檔上產生插入型幻覺。但被排除不等於被刪掉——三家的完整表照樣印在下面,Inflect-Micro-v2 在 Whisper large-v3 上是 2.73%。
題庫本身也凍結了。400 題,200 題是自訂的現代與壓力測試句、200 題來自 FLEURS 的美式英文測試集,語料的 SHA-256 校驗碼直接印在頁面上,並且跟 87,362 筆訓練轉錄做過原文排除。頭條的信賴區間跑了 10,000 次自助抽樣。
開放權重,不等於配方公開
授權欄寫 Apache-2.0,很多人看到這行就結案了。這份模型卡自己把邊界劃得更細。
公開的是:可部署權重、推論程式碼、英文前端程式碼、評測題目、原始辨識結果與各系統報告。沒公開的是:訓練語料的生成管線、私有的過濾基礎設施,以及完整的優化配方。作者用的詞是 open-weight——權重開放,訓練這件事不是。
這個區分對商用很重要。Apache-2.0 讓你可以把權重包進產品賣錢,這點沒有模糊空間。但你沒辦法照著這份文件重跑一次訓練,也沒辦法自己拿它去做中文——語言適配要重建正規化、音素、符號表、嵌入層和訓練資料,模型卡把這串清單直接列給你看了。
誰該下載,誰該關掉這頁
該下載的是這幾種人:產品要出英文語音、不想付雲端 API 的每字費用、或者文字根本不能離開自己機房的(內部工具、資料不出境的專案、離線裝置)。37 MB 塞得進容器映像檔,Apache-2.0 讓你可以直接商用,ONNX 版本連 PyTorch 都不用裝。
該關掉這頁的是:要中文的、要多個聲音的、要複製特定人聲的,還有產品裡語音走在醫療、法務、緊急通報或無障礙關鍵路徑上的——最後這條是模型卡自己列的不適用場景。
還沒有答案的有兩件。一是那個 v3:作者說想做更多語言和聲音,但沒有時程,也沒有說錢從哪來。二是訓練語料的來源——模型卡說聲音是合成的、不重新散布真人錄音語料,但外部無從查核它怎麼取得。
而這份文件真正值得同行抄走的,是它把可以被抓錯的每個位置都標出來了:樣本量、信賴區間、題庫雜湊、被排除的評測器和排除理由,以及自己在速度表上的名次。下次你讀到某個模型「在 benchmark 上領先」,可以拿這幾項回去對,看那份文件敢不敢印同樣的東西。
SOURCES
- A owensong/Inflect-Micro-v2 model card
- A owensong/Inflect-Micro-v2-ONNX
- A hexgrad/Kokoro-82M VOICES.md
- B Inflect-Micro-v2: complete voice in 9.36M parameters — Hacker News
來源分級:A = 一手公告/論文/官方文件 · B = 可信媒體 · C = 可參考但需脈絡 · D = 觀察用,不可當事實。
本文由 AI 協助研究與起草,矽基前沿編輯部編修,總編輯廖玄同審閱定稿。 編輯方針與 AI 使用說明