一句话:Sokuji 在你和会议软件之间插了一根「虚拟麦克风」——你说中文,对方听到的是英文;对方说的话,变成字幕回到你屏幕上。对方不用装任何东西,也不用点任何链接。

引子:这些场景你熟不熟悉?
- 跟外籍同事开英文会议,脑子里的中文要绕三圈才敢开口,说完了还担心对方没听懂?
- 想找个 AI 同传工具,结果要么要对方也装插件、要么要拉一个机器人进会?
- 用云端翻译,等于把会议音频整段传给第三方公司——合同、报价、人事谈话也这么传?
- 跨国会议全靠人肉翻译,一小时会议两小时准备,成本压不下来?
如果你中了一条以上,今天这个工具值得你花十分钟看完——它叫 Sokuji(即時),Kizuna AI Lab 出品的开源实时语音翻译工具,AGPL-3.0 协议,代码完全公开,而且最狠的一点:它能完全离线跑,音频一步都不出你的电脑。
一、这套方案是什么
Sokuji 是一个跨平台(Windows / macOS / Linux / Chrome / Edge)的实时双向语音翻译工具。
它的核心设计思路非常聪明:不做会议机器人,而是把自己伪装成一根麦克风。
传统 AI 同传要么让你装插件、要么拉一个「XX 会议助手」的机器人进会(对方还得同意邀请),Sokuji 完全绕开了这条路——它在你系统上注册成一个普通的虚拟麦克风,你在 Zoom / Teams / Meet 的音频设置里把它选为麦克风就行了。对端那边,一切照旧,什么都感知不到。

两种形态,能力完全一致:
| 桌面端 | 浏览器扩展 | |
|---|---|---|
| 平台 | Windows · macOS · Linux | Chrome · Edge(Chromium 116+) |
| 能用在哪 | 任何能选麦克风的应用——Zoom、Teams、Discord、Slack、OBS、游戏、录音软件 | 网页版会议平台——Zoom、Google Meet、Teams(免费版/工作版/M365)、Slack、Discord、Jitsi、Whereby、Gather Town |
| 安装 | 下载安装包 | 应用商店一键添加,零安装 |
| 反向翻译 | 读系统音频(视频、直播、录音都行) | 读当前标签页的音频 |
桌面端才是完全体:因为它工作在系统级,一个视频、一段直播、一个本地录音文件,都能被它实时翻成字幕——这是浏览器扩展做不到的。
二、为什么是它:核心优势拆解
2.1 先看痛点对比
| 你现在怎么办 | 问题 | Sokuji 怎么解 |
|---|---|---|
| 找人肉翻译 | 贵、要预约、有泄密风险 | 实时自动,零预约成本 |
| 用会议机器人/插件 | 对方也要装、要点同意、要拉机器人进会 | 对方零感知,什么都不用装 |
| 用云端翻译服务 | 会议音频整段上传第三方 | 本地推理模式,音频一步不出本机 |
| 自己搭 Whisper + 翻译 + TTS | 折腾环境、延迟高、链路难打通 | 一条龙打通,虚拟麦克风直出 |
2.2 七大优点详解
① 对方零安装、零感知
这是它最大的杀手锏。对方不用装插件、不用加链接、不用同意任何机器人入会——他们在自己的会议软件里,就是正常听到你在说他们的语言。会议礼仪和信任感完全不受影响。
② 完全离线可用,不花一分钱
Sokuji 支持 Local Inference(本地推理):语音识别、翻译、语音合成全在你机器上跑,不用 API Key、不用联网、不需要独显。靠 WASM + WebGPU,你的 CPU 和核显就能扛下来。
本地模型规模(官方数据):
- 44 个 ASR 模型(23 离线 + 10 流式 + 11 WebGPU),含 Whisper、Cohere Transcribe、Voxtral、Granite Speech,覆盖 99+ 语言
- 75 个翻译模型(69 个 Opus-MT 语言对 + 6 个多语言大模型:Qwen 2.5/3/3.5、Hunyuan-MT 1.5、TranslateGemma)
- 137 个 TTS 模型,覆盖 53 种语言(Piper、Piper-Plus、Coqui、Mimic3、Matcha、MMS、VITS、Supertonic)
- 一键下载模型,缓存到 IndexedDB,下过一次就不用再下
③ 音频不经过开发商服务器——架构上就不可能
官方说得很直白:云模式下,你的音频是直连你选的那家 AI 服务商(OpenAI / Gemini / 豆包……),Kizuna AI 不做中间人。API Key 只存在你本地,不上传。选本地推理则零网络请求。
④ 9 家服务商随你挑,国内也有能用的
需要更高精度时再上云,10+ 家可选(详见 2.3)。其中豆包 AST 2.0(火山引擎)支持中英双向、带说话人声音克隆,对国内用户很友好。而且全部支持自带 Key(BYOK)——你不买 Kizuna 的账号也能用。
⑤ 双向自动检测,两个人说两种语言也能聊
开启双向模式后,Sokuji 会自动判断当前是谁在说、说的是哪种语言,然后翻成另一边。设好 Language A / Language B,麦克风和系统音频同时采集,两边都能跟上(由 Soniox 双向模式驱动,60+ 语言、3600+ 语言对)。
⑥ AI 降噪 + 回声消除
内置 AI 降噪,键盘敲击声、环境噪声能压掉;回声消除基于现代 Web Audio API,避免自己说的话被重复采集。
⑦ 30 种界面语言 + 简/高级双模式
界面已本地化成 30 种语言。新手用 Simple Mode(简化设置),老手切 Advanced Mode 看波形、调细节。
2.3 服务商横向对比(官方数据)
| 服务商 | 特点 |
|---|---|
| OpenAI | gpt-realtime-mini / gpt-realtime-1.5 · 10 种声音 · 可配置轮次检测(Normal/Semantic/Disabled)· 降噪 · 60+ 语言 |
| Google Gemini | 动态模型选择 · 30 种声音 · 内置轮次检测 · 34 种语言变体 |
| Palabra.ai | WebRTC 低延迟 · 声音克隆 · 自动断句 · 60+ 源语言 / 40+ 目标语言 |
| Kizuna AI | 登录即用,Key 由后端托管,省事 |
| 豆包 AST 2.0 | 语音到语音 · 说话人声音克隆 · 中英双向 · Ogg Opus 输出 |
| Soniox | 实时语音到语音 · 单向 & 双向翻译(自动识别说话人语言) · 60+ 语言 / 3600+ 语言对 |
| Zoom AI Services | 纯文本实时字幕 · 自带 Zoom Build Platform Key · 不限于 Zoom,任何站点可用 |
| OpenAI Compatible | 自带端点,任何兼容 OpenAI Realtime API 的服务(仅桌面端) |
| Local Inference | 完全离线 · ASR→翻译→TTS 全本地 · 无 Key、无 GPU 要求 |
注:上表按官方 README 整理,非逐版本实测,以官方最新文档为准。
2.4 适合谁 / 不适合谁
✅ 强烈建议试试,如果:
- 经常开跨国会议、和海外客户/同事沟通;
- 团队里有语言障碍,但又不想让对方装一堆东西;
- 对隐私敏感——法务、医疗、金融、人事场景,音频不能出公司;
- 想在直播 / 网课 / 国际会议里做实时字幕;
- 想看外语视频、听外语播客但不想等字幕组。
❌ 暂时别急,如果:
- 你只在少数几个网页会议平台用,且愿意装扩展——那浏览器版更省事;
- 你对翻译精度要求达到专业同传级别(官方也坦承本地模式精度还不完全等同云端大模型,尤其冷门语言对)。
三、安装部署(重点)
项目完全免费开源,下载、安装、用自己的 Key 或用本地模型,都不需要注册账号。
3.1 部署前准备
系统要求(三端通用):64 位处理器、4GB 内存起(建议 8GB)、200MB 可用磁盘、麦克风 + 扬声器/耳机。
各平台的额外依赖(这是最容易踩坑的地方,先看好):
| 平台 | 需要什么 |
|---|---|
| Windows | Windows 10(1903+)或 11;VB-CABLE 虚拟声卡(安装程序会引导你装) |
| macOS | macOS 10.15+;Apple Silicon 或 Intel;管理员权限(装音频驱动要用);需手动移除隔离属性 |
| Linux | PulseAudio 或 PipeWire 运行中,另需 pulseaudio-utils(提供 pactl 命令) |
下载地址:
- 官网下载页:https://sokuji.kizuna.ai/download
- GitHub Releases:https://github.com/kizuna-ai-lab/sokuji/releases/latest

安装包对照表:
| 平台 | 包名 |
|---|---|
| Windows | Sokuji-x.y.z.Setup.exe(另有便携版) |
| macOS(Apple Silicon) | Sokuji-x.y.z-arm64.pkg |
| macOS(Intel) | Sokuji-x.y.z-x64.pkg |
| Linux(Debian/Ubuntu x64) | sokuji_x.y.z_amd64.deb |
| Linux(Debian/Ubuntu ARM64) | sokuji_x.y.z_arm64.deb |
| Linux(通用) | AppImage(x64 / arm64) |
3.2 Windows 安装(含 VB-CABLE 这个大坑)
第 1 步:下载并运行安装程序
从 Releases 页面下载 .exe 安装包。若 Windows Defender SmartScreen 弹出拦截:
- 点击警告窗口上的 「更多信息」
- 窗口展开后,点击 「仍要运行」
说明:Sokuji 的 Windows 版本由 SignPath Foundation 提供免费代码签名(开源项目福利),但 SmartScreen 仍可能根据下载来源提示。遇到就按上面两步放行,不影响使用。

第 2 步:安装 VB-CABLE 虚拟声卡
绕过 SmartScreen 后,安装程序会自动提示安装 VB-CABLE:
- 点击 「Install Now」 自动下载安装(也可以点「Download Manually」从 https://vb-audio.com/Cable/ 手动下)
- 弹出用户账户控制(UAC)时点 「是」
- VB-CABLE 安装程序打开后,点 「Install Driver」
- 等待安装完成,点 「OK」 确认,再点一次 「OK」 结束
第 3 步:验证 VB-CABLE 装好了
右键任务栏喇叭图标 → 「声音设置」,确认:
- CABLE Output (VB-Audio Virtual Cable) 出现在录制设备里
- CABLE Input (VB-Audio Virtual Cable) 出现在播放设备里
⚠️ 关键提示:你在 Sokuji 自己的设备列表里看不到这两个 CABLE 设备——这是官方刻意设计的。Sokuji 会隐藏它们以防你不小心选错造成音频回环(啸叫),并在后台自动检测使用 VB-CABLE。别去找,找不到是对的。

第 4 步:首次运行配置
VB-CABLE 装完后 Sokuji 会自动启动,进入音频配置页:
- 选择 AI 服务商(OpenAI / Gemini / 豆包 / Local Inference 等)
- 填入对应 API Key(选本地推理则跳过这步)
- 选择源语言和目标语言
- 测试音频输入输出设备
- Audio Input Device 选你的物理麦克风
- Virtual Speaker Monitor Device 选你的扬声器/耳机
点开始会话按钮,就能用了。
3.3 macOS 安装(Gatekeeper 是唯一的坑)
第 1 步:选对安装包
Apple 菜单 →「关于本机」看芯片:
- 看到 Apple M1/M2/M3/M4 → 下
Sokuji-x.y.z-arm64.pkg - 看到 Intel → 下
Sokuji-x.y.z-x64.pkg
(包约 150–200MB,已内含虚拟音频驱动)
第 2 步:必须先移除隔离属性(不做这步一定装不上)
macOS 的 PKG 安装包没有签名(免费项目付不起苹果每年开发者账号的费用,官方在下载页把这事说得很坦白),所以首次安装会被 Gatekeeper 拦下。
打开终端(应用程序 → 实用工具 → 终端),执行:
<code class="language-bash"># Apple Silicon(把 x.x.x 换成你的实际版本号) sudo xattr -d com.apple.quarantine ~/Downloads/Sokuji-x.x.x-arm64.pkg # Intel Mac sudo xattr -d com.apple.quarantine ~/Downloads/Sokuji-x.x.x-x64.pkg </code>
输入管理员密码回车。没有输出就是成功了。
第 3 步:安装 PKG
- 双击
.pkg文件 - 点「继续」→「安装」
- 输入管理员密码(装系统级音频驱动必须)
- 等 1–2 分钟完成,点「关闭」
这一步会装上三样东西:
Sokuji.app→/ApplicationsSokujiVirtualAudio.driver→/Library/Audio/Plug-Ins/HAL- 安装程序会自动重启 CoreAudio 加载驱动
第 4 步:首次启动
- 打开「应用程序」文件夹
- 右键(或 Control+点击)Sokuji → 选「打开」
- 弹窗中点「打开」确认
如果第 2 步的
xattr命令执行正确,你可能根本看不到安全警告。若仍被拦:系统设置 → 隐私与安全性 → 通用 → 看到 Sokuji 被阻止的提示 → 点「仍要打开」。
第 5 步:配置
授予麦克风权限 → 选界面语言 → 选服务商 → 填 Key → 选源/目标语言 → 选音频设备(设备列表里应该能看到 Sokuji Virtual Audio)→ 测试麦克风和扬声器。
3.4 Linux 安装(最省心)
Linux 是三个平台里最省事的——虚拟麦克风由 Sokuji 自己通过 PulseAudio/PipeWire 创建,不需要额外装任何虚拟声卡驱动。
前置:确认音频服务器和工具
<code class="language-bash"># 确认 PulseAudio 或 PipeWire 在运行 pactl info | grep "Server Name" # Debian/Ubuntu 若缺 pactl,先装工具包 sudo apt update && sudo apt install -y pulseaudio-utils </code>
安装方式一:deb 包
<code class="language-bash"># x64 机器 sudo dpkg -i sokuji_x.y.z_amd64.deb # ARM64 机器(如树莓派、部分 NAS) sudo dpkg -i sokuji_x.y.z_arm64.deb # 若提示依赖缺失,补一下 sudo apt -f install </code>
安装方式二:AppImage(通用,不需要 root)
<code class="language-bash">chmod +x Sokuji-x.y.z.AppImage ./Sokuji-x.y.z.AppImage </code>
3.5 浏览器扩展安装(最轻量,推荐先试)
如果你只用网页版会议(Google Meet、Teams 网页版、Zoom 网页版等),浏览器扩展是最快的上手方式——系统里什么都不用装,也不用折腾音频路由。
方式一:应用商店一键装(Chromium 116+)
- Chrome:https://chromewebstore.google.com/detail/sokuji-extension/ppmihnhelgfpjomhjhpecobloelicnak
- Edge:https://microsoftedge.microsoft.com/addons/detail/sokuji-ai-meeting-trans/dcmmcdkeibkalgdjlahlembodjhijhkm
方式二:开发者模式手动装
- 从 Releases 页面下载
sokuji-extension.zip并解压 - 浏览器打开
chrome://extensions/,右上角开启**「开发者模式」** - 点 「加载已解压的扩展程序」,选择解压出来的文件夹
扩展支持的平台:Zoom · Google Meet · Microsoft Teams(免费版/工作版/M365)· Slack · Discord · Jitsi Meet · Whereby · Gather Town · Yandex Telemost。
超出这个范围(本地软件、游戏、桌面端 OBS、浏览器外的视频),请用桌面端。
3.6 从源码构建(可选)
开源项目,想自己改或审查代码的话:
<code class="language-bash">git clone https://github.com/kizuna-ai-lab/sokuji.git cd sokuji && npm install npm run electron:dev # 开发模式运行 npm run electron:build # 生产构建 </code>
需要 Node.js(推荐最新 LTS 版)+ npm。
3.7 配置 AI 服务商:云端还是本地?
这是决定延迟和隐私的关键一步,两条路:
路线 A:本地推理(推荐先试这个)
- 服务商选 Local Inference
- 不需要 API Key、不需要联网、不需要独显
- 首次使用时一键下载模型,缓存到浏览器 IndexedDB,之后完全离线
- 适合:隐私敏感场景、想零成本试用、网络环境差
路线 B:云端大模型(精度更高)
- 选 OpenAI / Gemini / 豆包 AST 2.0 / Soniox / Palabra.ai 等
- 填入你自己的 API Key(也支持 OpenAI 兼容的自定义端点,仅桌面端)
- 适合:追求翻译质量、冷门语言对、正式商务场合
国内用户建议:豆包 AST 2.0(火山引擎)支持中英双向且带声音克隆,延迟和合规性对国内更友好。
3.8 在会议软件里启用(最后一步)
- 打开 Zoom / Teams / Meet 的音频设置
- 把麦克风选为 Sokuji(或 Sokuji Virtual Microphone)
- 正常开始会议,开口说话——对方听到的就是翻译后的声音
想看对方说话的字幕?
- 桌面端:直接采集系统音频,对方说的话会实时转成你语言的字幕(视频、直播、录音同理)
- 浏览器扩展:读取当前标签页音频
想做真正的双语会议?
- 开启双向模式,设好 Language A / Language B
- 麦克风 + 系统音频同时采集,自动判断谁在说、说什么语言
- 可以共享屏幕让对方也看到字幕
四、故障排查表
| 现象 | 原因 / 解决办法 |
|---|---|
| Windows:SmartScreen 拦截安装 | 点「更多信息」→「仍要运行」 |
| Windows:VB-CABLE 设备找不到 | ① 重启电脑(大概率解决)② 声音设置里确认 CABLE Input/Output ③ 手动重装:从 vb-audio.com/Cable/ 下载解压,以管理员运行 VBCABLE_Setup_x64.exe,重启 ④ 设备管理器 →「声音、视频和游戏控制器」确认 VB-Audio Virtual Cable 无报错 |
| Windows:在 Sokuji 里看不到 CABLE 设备 | 正常现象,官方刻意隐藏以防音频回环,后台自动使用,不用管 |
| Windows:麦克风检测不到 | 设置 → 隐私 → 麦克风 → 开启「允许应用访问麦克风」,并确认 Sokuji 已勾选 |
| Windows:应用起不来 | 右键以管理员运行 / 检查杀毒软件是否拦截 / 重装 / 更新系统 |
| macOS:提示”套件已损坏,无法打开” | 隔离属性没去掉,重跑:sudo xattr -d com.apple.quarantine ~/Downloads/Sokuji-*.pkg |
| macOS:提示”来自身份不明的开发者” | 右键 Sokuji →「打开」→ 确认打开(只需一次) |
| macOS:虚拟音频驱动不显示 | ① ls /Library/Audio/Plug-Ins/HAL/ 检查 ② 重启 CoreAudio:sudo killall coreaudiod ③ 系统设置 → 声音里看设备是否出现 |
| macOS:Intel Mac 崩溃/卡顿 | 确认下的是 x64 而不是 arm64 版本;仍不行去 Console.app 查崩溃日志并提交 GitHub |
| Linux:虚拟麦克风没出现 | 确认 PulseAudio/PipeWire 在运行,且装了 pulseaudio-utils |
| 无音频输出 | 检查系统输出设备是否选对、音量是否静音;在 Sokuji 里确认输出设备选择正确 |
| 翻译延迟高 | 换云端服务商;或本地模式换更小的模型(如 ASR 选 tiny/base 级别) |
五、安全与隐私清单
发布和使用前,这几条值得留意:
- ✅ 本地推理模式:音频 100% 在本机处理,零网络请求,这是隐私最优解。
- ✅ 云模式:音频直连你选的服务商,Kizuna AI 不做中间服务器;API Key 仅存本地,不上传。
- ⚠️ 匿名遥测:项目使用 PostHog 收集匿名使用统计(不含音频)。介意的话请自行评估。
- ⚠️ macOS 未签名:官方坦承未签名(付不起苹果年费),需手动
xattr去隔离属性。只从官方 GitHub Releases 或官网下载,别用第三方镜像。 - ⚠️ 商用注意协议:项目为 AGPL-3.0。若你基于它做网络服务对外提供,AGPL 要求你同样开源——企业集成前请让法务过一眼。
- ⚠️ 模型许可证:内置的第三方模型(Whisper、Piper、Opus-MT 等)各有自己的许可证,商用前查一下仓库里的
THIRD_PARTY_NOTICES.md。
六、一句话结论
Sokuji 的价值不在”又做了一个翻译器”,而在把同传这件事的摩擦降到了零——对方不用装、不用点、不用知道;你要么花几块钱接云端,要么干脆断网用本地模型,连音频都不用出公司。加上 AGPL 开源、三端通吃、虚拟麦克风随便接到任何软件,它大概是当前开源圈里完成度相当高的实时同传方案。
你平时跨国沟通最大的卡点是啥?是”不敢开口”、是”对方嫌装插件麻烦”、还是”公司不让传音频到第三方”?
评论区说说你的场景,我可以帮你判断走本地离线还是云端 + 自带 Key 更合适。
相关链接
- 官网:https://sokuji.kizuna.ai/
- 下载:https://sokuji.kizuna.ai/download
- GitHub(AGPL-3.0):https://github.com/kizuna-ai-lab/sokuji
- Windows 安装文档:https://sokuji.kizuna.ai/docs/install/windows
- macOS 安装文档:https://sokuji.kizuna.ai/docs/install/macos
- Chrome 扩展:https://chromewebstore.google.com/detail/sokuji-extension/ppmihnhelgfpjomhjhpecobloelicnak
- Edge 扩展:https://microsoftedge.microsoft.com/addons/detail/sokuji-ai-meeting-trans/dcmmcdkeibkalgdjlahlembodjhijhkm
