Capby SZ

幫影片上字幕,免費。自動聽寫、逐詞時間戳,剩下的每一句,在波形時間軸上修到好。

打開 Cap已上線 cap.sz.ws
自備 Groq key —— 兩者都免費

實錄完整流程 —— 影片丟進來,逐字稿自己落地,修一句,挑個版型。

確實免費

聽寫跑在你自己的免費 Groq key 上,Cap 不另外收錢。影片不會上傳到 Cap 的伺服器。

模型現在是自己的

中文斷句換成 Cap 自己訓練的模型,走 ONNX 在你的瀏覽器裡跑,雲端模型退成備援。台語走 Cap 自架的模型,那是 Whisper 沒有的語言。

AI 會先問過你

修字把整份逐字稿讀完,提出一張替換表。每一條都過同音驗貨,可以改、也可以否決;按下套用之前,稿子一個字都不會動。

整條線都在你的機器上跑,只有一步會離開

Cap 處理影片的所有動作都在你的瀏覽器分頁裡:讀檔、抽聲音、切段、縫合、斷句、存檔。只有一步需要連出去,就是送去聽寫服務,用的也是你自己的免費金鑰。

  1. 讀取檔案
  2. →抽出聲音
  3. →切成片段
  4. →送去轉譯
  5. →縫合重疊的地方
  6. →照語意斷句
  7. →收尾存檔

唯一離開的一步

這七個就是進度條上會跑的步驟。影片檔本身完全不會離開你的電腦,送出去的只有當下那小段聲音,而且只去你自己給金鑰的那個服務。

有兩個模型直接跑在你的瀏覽器裡

字幕要在哪裡斷行以前都得送出去問。現在不用了,Cap 自己訓練了一個模型在本機跑,另外還有個小模型負責聽這段聲音到底有沒有人在講話。

一行字在哪裡斷

42 MB · Cap 自己訓練的

專門為這件事訓練的模型,負責把字幕斷在讀起來順的地方。第一次用到時載一次就好,之後都留在瀏覽器裡。遇到它不會的語言,才會丟給雲端模型當後備。

這段有沒有人在講話

2.3 MB · Silero VAD

跟著網頁一起載的開源小模型,只做一件事:判斷這段聲音有沒有人聲。有了它的確認,後面才敢放心刪掉多餘的東西。

片尾那句假的道別,就是這樣被拿掉的

聽寫模型很愛在片尾音樂自己腦補客套話。Cap 認得出常見的那幾句,但光認得還不敢亂刪,一定要人聲偵測也確定沒人在講話才會清掉。拿不準的就通通留著。

修字這一步,動手前會先問過你

聽寫最容易搞錯人名、術語跟地名,而且每次錯得都一樣。Cap 產完逐字稿會先跑一次抓出建議修改,停下來等你看過才動作。

01

整份讀兩次

第一輪先抓明顯的錯,第二輪再讀替換後的版本抓深一層的錯。很多問題得等第一輪清掉才看得到。

02

只收聽起來一樣的

每條修改建議都要對過讀音。這裡不會讓模型自作聰明去修飾語句,聽錯的字讀音通常差不多,改寫就不是了。

03

每一條都可以由你決定

要改字或整條略過都可以。在你按套用之前,字幕上的字一個都不會動。

04

你接受過的,它會記住

你放行的詞會存進自己的詞庫,下次做新影片時一開始就認得。

規格
0影片上傳
逐詞時間戳
5 種語言
SRT · VTT燒進影片,或單獨一支透明軌

向 What'Sub 致敬 —— Cap 是看到它才做的。