實錄完整流程 —— 影片丟進來,逐字稿自己落地,修一句,挑個版型。
聽寫跑在你自己的免費 Groq key 上,Cap 不另外收錢。影片不會上傳到 Cap 的伺服器。
中文斷句換成 Cap 自己訓練的模型,走 ONNX 在你的瀏覽器裡跑,雲端模型退成備援。台語走 Cap 自架的模型,那是 Whisper 沒有的語言。
修字把整份逐字稿讀完,提出一張替換表。每一條都過同音驗貨,可以改、也可以否決;按下套用之前,稿子一個字都不會動。
Cap 處理影片的所有動作都在你的瀏覽器分頁裡:讀檔、抽聲音、切段、縫合、斷句、存檔。只有一步需要連出去,就是送去聽寫服務,用的也是你自己的免費金鑰。
唯一離開的一步
這七個就是進度條上會跑的步驟。影片檔本身完全不會離開你的電腦,送出去的只有當下那小段聲音,而且只去你自己給金鑰的那個服務。
字幕要在哪裡斷行以前都得送出去問。現在不用了,Cap 自己訓練了一個模型在本機跑,另外還有個小模型負責聽這段聲音到底有沒有人在講話。
42 MB · Cap 自己訓練的
專門為這件事訓練的模型,負責把字幕斷在讀起來順的地方。第一次用到時載一次就好,之後都留在瀏覽器裡。遇到它不會的語言,才會丟給雲端模型當後備。
2.3 MB · Silero VAD
跟著網頁一起載的開源小模型,只做一件事:判斷這段聲音有沒有人聲。有了它的確認,後面才敢放心刪掉多餘的東西。
聽寫模型很愛在片尾音樂自己腦補客套話。Cap 認得出常見的那幾句,但光認得還不敢亂刪,一定要人聲偵測也確定沒人在講話才會清掉。拿不準的就通通留著。
聽寫最容易搞錯人名、術語跟地名,而且每次錯得都一樣。Cap 產完逐字稿會先跑一次抓出建議修改,停下來等你看過才動作。
第一輪先抓明顯的錯,第二輪再讀替換後的版本抓深一層的錯。很多問題得等第一輪清掉才看得到。
每條修改建議都要對過讀音。這裡不會讓模型自作聰明去修飾語句,聽錯的字讀音通常差不多,改寫就不是了。
要改字或整條略過都可以。在你按套用之前,字幕上的字一個都不會動。
你放行的詞會存進自己的詞庫,下次做新影片時一開始就認得。
向 What'Sub 致敬 —— Cap 是看到它才做的。