← 返回 Projects

Open Source · Local ASR

聲音辨識小工具

本地語音辨識字幕工具 —— 資料不離開你的電腦。以 Qwen3-ASR / Breeze-ASR-26 為核心, 音檔、影片、麥克風錄音都能轉成 SRT 字幕。目標很單純:讓你的同事、你的同學、你的阿嬤, 都能免費、離線、在自己的電腦上做語音辨識。

MIT 開源 本地可執行 Windows 10 / 11 64-bit CPU / GPU 通吃

實作影片

Live Demo
軟體基礎功能 — 拖入音檔/影片,一鍵轉 SRT
國語逐字伴唱 — 字級時間軸、卡拉OK逐字高亮
台語逐字跟隨 — Breeze-ASR 台語特化,逐字對齊

介面導覽

WebView UI · teal

核心功能

Features

🎧 音檔/影片 → SRT

MP3・WAV・FLAC・M4A 等音訊,及 MP4・MKV・MOV 影片(自動用 ffmpeg 抽音軌),一鍵轉 SRT 字幕。

🎙️ 麥克風錄製轉換

偵測說話停頓自動分段辨識,可邊錄邊即時存檔,適合會議、訪談現場紀錄。

🎤 卡拉OK逐字模式

字級時間軸貫通,播放時逐字高亮歌詞、下一句淡色預覽,適合對歌詞、字幕校對與教學展示。

🌏 多語系 + 日語強化

中日英等 30 種語系自動偵測或鎖定;內建 Qwen3-ASR 日語動漫特化模型,日文歌詞台詞辨識明顯較佳、保留原生漢字。

👥 說話者分離

可指定人數,SRT 自動標記「說話者1/2…」,多人對話一目了然。

📚 批次辨識

一次匯入大量音訊/影片依序辨識,適合整批會議錄音、多集 Podcast、課堂錄影。

🔌 OpenAI 相容端點

內建 OpenAI 相容轉錄 API + 手機掃碼上傳頁 + Cloudflare 對外通道,可被腳本、OpenWebUI 串接。

🧩 多推理核心

CrispASR(Vulkan GPU,NVIDIA/AMD/Intel 通吃,免裝 CUDA)與 OpenVINO(純 CPU,免顯卡),一鍵切換。

下載使用

Windows 64-bit 單獨執行檔,解壓後執行即可。首次啟動會依所選模型自動下載並配置,不需手動安裝任何依賴。

※ 若 Windows 阻擋執行,於 exe 按右鍵 → 內容 → 勾選「解除封鎖」(Mark-of-the-Web)

⬇ 前往 GitHub 下載