矽基前沿 [Si]gnals
一列由大到小依序排開的灰色方塊,最小的一塊落在最右端,以細藍色框線與貫穿底部的藍色基線標出
工作現場

TTS 只剩 37MB,Inflect 連自己輸的那欄都印出來

他為什麼要印自己輸的那一欄?

模型卡拉到第四節,有一張六列的速度表。第一名是 Piper Low,31.37 倍即時;接著 KittenTTS Nano 13.33 倍、Inflect-Nano-v2 10.72 倍、Supertonic 3 的三步模式 10.15 倍。

Inflect-Micro-v2 排第五,6.28 倍。這張排行表,就印在它自己的模型卡上。

放這張表的人叫 Owen Song,他在 2026 年 7 月 26 日於 Hugging Face 放出 Inflect-Micro-v2——9,356,513 個可部署參數、FP32 權重 37.53 MB、24 kHz 單聲道輸出、Apache-2.0 授權,一顆完整跑在自己電腦上的英文語音合成模型。同一天這則貼文進了 Hacker News 首頁,185 分。他在模型卡開頭寫,這個專案是他獨立做、獨立出資的,如果真的有人在用,他想繼續做涵蓋更多語言和聲音的 v3。

表格下面還有一段話。他寫明這張表本來就不對等:Inflect 這兩列跑的是 100 題的穩態測試,其他系統跑的是 50 題的確認測試;而且好幾個對照組用的是優化過的 ONNX 執行環境,他自己這兩個數字跑的是原生 PyTorch。

整張表長這樣:

名次系統音訊長度 ÷ 實際耗時
1Piper Low31.37×
2KittenTTS Nano13.33×
3Inflect-Nano-v210.72×
4Supertonic 3(三步)10.15×
5Inflect-Micro-v26.28×
6Supertonic 3(八步)4.37×

37MB 裝得下整條路,聲碼器也包在裡面

先把規格講清楚,這樣你才知道 6.28 倍是快是慢。

這顆模型是 VITS 家族的端到端文字轉波形生成器:英文音素前端、單調對齊、隨機潛在合成、殘差耦合流,最後那顆神經聲碼器整合在同一份權重裡。你不需要另外掛一個 vocoder,也不需要在推論時載入任何外部模型或參考音檔。

37.53 MB 是這一整條路徑加起來的大小。6.28 倍即時的意思是,在 Hugging Face 的 8 vCPU 機器上開四個執行緒,跑一分鐘的語音大約花你十秒。它在那張表上排倒數第二,但仍然比即時快六倍有餘——生成永遠追得上播放。

模型卡的標題寫 complete voice。討論串當天就有人跳出來澄清這個字:它指的是文字到波形的完整路徑,不含語音辨識。你拿它做不出語音助理的耳朵,只做得出嘴巴。

官方另外釋出了 ONNX 版本,把模型拆成 duration.onnxdecode.onnx 兩張圖,支援 CPU、CUDA 和 DirectML,整條路不需要匯入 PyTorch。討論串裡當天就有人拿它做了在瀏覽器裡直接跑的展示頁,也有人把它接進 Linux 的 speech-dispatcher 當系統朗讀。這兩個都是社群作品,不是官方支援。

三顆能離線跑的選項,中文只有一顆有

限制段落寫在賣點旁邊,四句話:英文限定、只有一個固定男聲、零樣本聲音複製做不到、新聲音與新語言「目前未驗證也不支援」。第四句還補了一刀——換一個新聲音的做法是把原本那個換掉,你手上永遠只有一個聲音可用。

對做繁中產品的人來說,這四句話等於直接關門。所以先把離線這條路上真正能挑的東西並排:

Inflect-Micro-v2Inflect-Nano-v2Kokoro-82M
參數9,356,5133,966,72182M(官方標示)
FP32 權重37.53 MB15.97 MB官方未標示
授權Apache-2.0Apache-2.0Apache-2.0
語言英文英文8 語系
聲音1 個固定男聲1 個固定男聲54 個
有華語嗎沒有沒有有,4 女 4 男

要中文,路在最右邊那欄。Kokoro-82M 同樣是 Apache-2.0,官方的 VOICES.md 列了 8 個語系共 54 個聲音,華語有 4 女 4 男。但同一份文件也自己標了但書:非英語的支援「可能缺席或很薄」,原因是字音轉換品質與訓練資料量。挑的時候把這句一起帶著。

66.2% 這個數字的分母是 34 場

模型卡頭條那一列有五個數字:社群盲測偏好率 66.2%、UTMOS22 分數 4.395、兩家語音辨識器的語意錯字率 3.99%、權重 37.53 MB、CPU 6.28 倍即時。它們各自獨立列出,沒有被壓成一個總分。

66.2% 這格點開來,是 21 勝、10 敗、3 平,平手算半勝——總共 34 場。作者自己在下面寫,這是描述性的社群證據,不是正式的 MOS 聽測。同一段也標明 UTMOS22 是一個學習出來的預測器,不等於人類評分;95% 的自助抽樣信賴區間落在 4.381 到 4.408。

所以這顆模型好不好聽,這份文件沒有給你答案,它給的是一組你可以自己去戳的數字。討論串裡的評價也確實分岔:有人說品質跟歷史上那些 TTS 工具差不多,跟 macOS 內建的 Samantha 比只是「marginally better」;也有人直接反駁,說比十年前任何東西都好聽。我們沒有播放過任何一段樣本,這裡只轉述。

語音辨識器那格更有意思。頭條分數只採兩家(Qwen3-ASR 與 Nemotron 3.5),Whisper 被排除,理由寫在旁邊:它在部分 Supertonic 八步模式的音檔上產生插入型幻覺。但被排除不等於被刪掉——三家的完整表照樣印在下面,Inflect-Micro-v2 在 Whisper large-v3 上是 2.73%。

題庫本身也凍結了。400 題,200 題是自訂的現代與壓力測試句、200 題來自 FLEURS 的美式英文測試集,語料的 SHA-256 校驗碼直接印在頁面上,並且跟 87,362 筆訓練轉錄做過原文排除。頭條的信賴區間跑了 10,000 次自助抽樣。

開放權重,不等於配方公開

授權欄寫 Apache-2.0,很多人看到這行就結案了。這份模型卡自己把邊界劃得更細。

公開的是:可部署權重、推論程式碼、英文前端程式碼、評測題目、原始辨識結果與各系統報告。沒公開的是:訓練語料的生成管線、私有的過濾基礎設施,以及完整的優化配方。作者用的詞是 open-weight——權重開放,訓練這件事不是。

這個區分對商用很重要。Apache-2.0 讓你可以把權重包進產品賣錢,這點沒有模糊空間。但你沒辦法照著這份文件重跑一次訓練,也沒辦法自己拿它去做中文——語言適配要重建正規化、音素、符號表、嵌入層和訓練資料,模型卡把這串清單直接列給你看了。

誰該下載,誰該關掉這頁

該下載的是這幾種人:產品要出英文語音、不想付雲端 API 的每字費用、或者文字根本不能離開自己機房的(內部工具、資料不出境的專案、離線裝置)。37 MB 塞得進容器映像檔,Apache-2.0 讓你可以直接商用,ONNX 版本連 PyTorch 都不用裝。

該關掉這頁的是:要中文的、要多個聲音的、要複製特定人聲的,還有產品裡語音走在醫療、法務、緊急通報或無障礙關鍵路徑上的——最後這條是模型卡自己列的不適用場景。

還沒有答案的有兩件。一是那個 v3:作者說想做更多語言和聲音,但沒有時程,也沒有說錢從哪來。二是訓練語料的來源——模型卡說聲音是合成的、不重新散布真人錄音語料,但外部無從查核它怎麼取得。

而這份文件真正值得同行抄走的,是它把可以被抓錯的每個位置都標出來了:樣本量、信賴區間、題庫雜湊、被排除的評測器和排除理由,以及自己在速度表上的名次。下次你讀到某個模型「在 benchmark 上領先」,可以拿這幾項回去對,看那份文件敢不敢印同樣的東西。

SOURCES

  1. A owensong/Inflect-Micro-v2 model card
  2. A owensong/Inflect-Micro-v2-ONNX
  3. A hexgrad/Kokoro-82M VOICES.md
  4. B Inflect-Micro-v2: complete voice in 9.36M parameters — Hacker News

來源分級:A = 一手公告/論文/官方文件 · B = 可信媒體 · C = 可參考但需脈絡 · D = 觀察用,不可當事實。

本文由 AI 協助研究與起草,矽基前沿編輯部編修,總編輯廖玄同審閱定稿。 編輯方針與 AI 使用說明

WEEKLY [SI]GNALS

訂閱《矽基前沿週報》

每週五早上,把本週 AI 與算力產業最值得記住的變化連回台灣。

本週關鍵訊號 · 為什麼值得記住 · 下週觀察 · 5 分鐘讀完。

免費 · 隨時取消 · 不轉售你的 email。

MACHINE-READABLE SUMMARY

Topic
工作現場
Key claims
  • Inflect-Micro-v2 於 2026-07-26 在 Hugging Face 釋出,模型卡標示 9,356,513 個可部署參數、FP32 權重 37.53 MB、24 kHz 單聲道輸出,授權為 Apache-2.0。
  • 它是 VITS 家族的端到端文字轉波形生成器,神經聲碼器整合在權重內;模型卡所稱的 complete 指完整的文字到波形路徑,不包含語音辨識。
  • 模型卡自己的 CPU 速度對照表中,Inflect-Micro-v2 以 6.28 倍即時排在倒數第二,落後 Piper Low 的 31.37 倍、KittenTTS Nano 的 13.33 倍與自家 Inflect-Nano-v2 的 10.72 倍。
  • 該表下方由作者註明比較條件不對等:Inflect 採 100 題穩態跑,對照組採 50 題確認跑,且多個對照組使用優化過的 ONNX 執行環境,Inflect 該組數字使用原生 PyTorch。
  • 頭條的 66.2% 社群盲測偏好率,分母是 34 場(21 勝、10 敗、3 平,平手算半勝),模型卡原文標明這是描述性社群證據而非正式 MOS。
  • 模型卡限制段落載明:英文限定、單一固定男聲、非零樣本聲音複製,新聲音與新語言目前未驗證亦不支援,且更換聲音是取代原有聲音而非新增可選聲音。
  • 這是開放權重而非開源訓練——權重、推論碼、前端碼與評測產物公開,但訓練語料生成管線、私有過濾基礎設施與完整優化配方不在公開包內。
  • 同為 Apache-2.0 的 Kokoro-82M 依官方 VOICES.md 提供 8 語系 54 個聲音,含華語 4 女 4 男;同一份文件亦載明非英語支援可能缺席或很薄。
Entities
Owen Song · Inflect-Micro-v2 · Inflect-Nano-v2 · Hugging Face · Kokoro-82M · Piper · KittenTTS · Supertonic · VITS · UTMOS22 · Apache-2.0
Taiwan relevance
medium
Confidence
high
Last updated
2026-07-26
Canonical URL
https://signals.tw/articles/inflect-micro-v2-10m-local-tts/

SUGGESTED CITATION

如果 AI agent / 研究 / 報導要引用本文,建議格式如下:

矽基前沿 · 工作現場線(編輯:廖玄同),《TTS 只剩 37MB,Inflect 連自己輸的那欄都印出來》,矽基前沿 [Si]gnals,2026-07-26。https://signals.tw/articles/inflect-micro-v2-10m-local-tts/

AI agents / search engines may quote, summarize, and cite with attribution and a link back to the canonical URL above. See /for-ai-agents for full policy.