• 欢迎访问誉卿博客,推荐使用最新版火狐浏览器和 Chrome 浏览器访问本网站。

  • 初不解禅心未住,悟后逍遥游处方。 山水有情皆由心,见山见水皆天堂。

跨国会议不用等翻译了:这个开源 AI 同传,对方什么都不用装

工具 yqdnsjs 1个月前 (09-04) 112次浏览 扫描二维码

一句话:Sokuji 在你和会议软件之间插了一根「虚拟麦克风」——你说中文,对方听到的是英文;对方说的话,变成字幕回到你屏幕上。对方不用装任何东西,也不用点任何链接。

Sokuji 实时 AI 同传总流程

引子:这些场景你熟不熟悉?

  1. 跟外籍同事开英文会议,脑子里的中文要绕三圈才敢开口,说完了还担心对方没听懂?
  2. 想找个 AI 同传工具,结果要么要对方也装插件、要么要拉一个机器人进会?
  3. 用云端翻译,等于把会议音频整段传给第三方公司——合同、报价、人事谈话也这么传?
  4. 跨国会议全靠人肉翻译,一小时会议两小时准备,成本压不下来?

如果你中了一条以上,今天这个工具值得你花十分钟看完——它叫 Sokuji(即時),Kizuna AI Lab 出品的开源实时语音翻译工具,AGPL-3.0 协议,代码完全公开,而且最狠的一点:它能完全离线跑,音频一步都不出你的电脑。


一、这套方案是什么

Sokuji 是一个跨平台(Windows / macOS / Linux / Chrome / Edge)的实时双向语音翻译工具。

它的核心设计思路非常聪明:不做会议机器人,而是把自己伪装成一根麦克风。

传统 AI 同传要么让你装插件、要么拉一个「XX 会议助手」的机器人进会(对方还得同意邀请),Sokuji 完全绕开了这条路——它在你系统上注册成一个普通的虚拟麦克风,你在 Zoom / Teams / Meet 的音频设置里把它选为麦克风就行了。对端那边,一切照旧,什么都感知不到。

Sokuji 虚拟麦克风路由示意

两种形态,能力完全一致:

桌面端 浏览器扩展
平台 Windows · macOS · Linux Chrome · Edge(Chromium 116+)
能用在哪 任何能选麦克风的应用——Zoom、Teams、Discord、Slack、OBS、游戏、录音软件 网页版会议平台——Zoom、Google Meet、Teams(免费版/工作版/M365)、Slack、Discord、Jitsi、Whereby、Gather Town
安装 下载安装包 应用商店一键添加,零安装
反向翻译 读系统音频(视频、直播、录音都行) 读当前标签页的音频

桌面端才是完全体:因为它工作在系统级,一个视频、一段直播、一个本地录音文件,都能被它实时翻成字幕——这是浏览器扩展做不到的。


二、为什么是它:核心优势拆解

2.1 先看痛点对比

你现在怎么办 问题 Sokuji 怎么解
找人肉翻译 贵、要预约、有泄密风险 实时自动,零预约成本
用会议机器人/插件 对方也要装、要点同意、要拉机器人进会 对方零感知,什么都不用装
用云端翻译服务 会议音频整段上传第三方 本地推理模式,音频一步不出本机
自己搭 Whisper + 翻译 + TTS 折腾环境、延迟高、链路难打通 一条龙打通,虚拟麦克风直出

2.2 七大优点详解

① 对方零安装、零感知
这是它最大的杀手锏。对方不用装插件、不用加链接、不用同意任何机器人入会——他们在自己的会议软件里,就是正常听到你在说他们的语言。会议礼仪和信任感完全不受影响。

② 完全离线可用,不花一分钱
Sokuji 支持 Local Inference(本地推理):语音识别、翻译、语音合成全在你机器上跑,不用 API Key、不用联网、不需要独显。靠 WASM + WebGPU,你的 CPU 和核显就能扛下来。

本地模型规模(官方数据):

  • 44 个 ASR 模型(23 离线 + 10 流式 + 11 WebGPU),含 Whisper、Cohere Transcribe、Voxtral、Granite Speech,覆盖 99+ 语言
  • 75 个翻译模型(69 个 Opus-MT 语言对 + 6 个多语言大模型:Qwen 2.5/3/3.5、Hunyuan-MT 1.5、TranslateGemma)
  • 137 个 TTS 模型,覆盖 53 种语言(Piper、Piper-Plus、Coqui、Mimic3、Matcha、MMS、VITS、Supertonic)
  • 一键下载模型,缓存到 IndexedDB,下过一次就不用再下

③ 音频不经过开发商服务器——架构上就不可能
官方说得很直白:云模式下,你的音频是直连你选的那家 AI 服务商(OpenAI / Gemini / 豆包……),Kizuna AI 不做中间人。API Key 只存在你本地,不上传。选本地推理则零网络请求。

④ 9 家服务商随你挑,国内也有能用的
需要更高精度时再上云,10+ 家可选(详见 2.3)。其中豆包 AST 2.0(火山引擎)支持中英双向、带说话人声音克隆,对国内用户很友好。而且全部支持自带 Key(BYOK)——你不买 Kizuna 的账号也能用。

⑤ 双向自动检测,两个人说两种语言也能聊
开启双向模式后,Sokuji 会自动判断当前是谁在说、说的是哪种语言,然后翻成另一边。设好 Language A / Language B,麦克风和系统音频同时采集,两边都能跟上(由 Soniox 双向模式驱动,60+ 语言、3600+ 语言对)。

⑥ AI 降噪 + 回声消除
内置 AI 降噪,键盘敲击声、环境噪声能压掉;回声消除基于现代 Web Audio API,避免自己说的话被重复采集。

⑦ 30 种界面语言 + 简/高级双模式
界面已本地化成 30 种语言。新手用 Simple Mode(简化设置),老手切 Advanced Mode 看波形、调细节。

2.3 服务商横向对比(官方数据)

服务商 特点
OpenAI gpt-realtime-mini / gpt-realtime-1.5 · 10 种声音 · 可配置轮次检测(Normal/Semantic/Disabled)· 降噪 · 60+ 语言
Google Gemini 动态模型选择 · 30 种声音 · 内置轮次检测 · 34 种语言变体
Palabra.ai WebRTC 低延迟 · 声音克隆 · 自动断句 · 60+ 源语言 / 40+ 目标语言
Kizuna AI 登录即用,Key 由后端托管,省事
豆包 AST 2.0 语音到语音 · 说话人声音克隆 · 中英双向 · Ogg Opus 输出
Soniox 实时语音到语音 · 单向 & 双向翻译(自动识别说话人语言) · 60+ 语言 / 3600+ 语言对
Zoom AI Services 纯文本实时字幕 · 自带 Zoom Build Platform Key · 不限于 Zoom,任何站点可用
OpenAI Compatible 自带端点,任何兼容 OpenAI Realtime API 的服务(仅桌面端)
Local Inference 完全离线 · ASR→翻译→TTS 全本地 · 无 Key、无 GPU 要求

注:上表按官方 README 整理,非逐版本实测,以官方最新文档为准。

2.4 适合谁 / 不适合谁

✅ 强烈建议试试,如果:

  • 经常开跨国会议、和海外客户/同事沟通;
  • 团队里有语言障碍,但又不想让对方装一堆东西;
  • 对隐私敏感——法务、医疗、金融、人事场景,音频不能出公司;
  • 想在直播 / 网课 / 国际会议里做实时字幕;
  • 想看外语视频、听外语播客但不想等字幕组。

❌ 暂时别急,如果:

  • 你只在少数几个网页会议平台用,且愿意装扩展——那浏览器版更省事;
  • 你对翻译精度要求达到专业同传级别(官方也坦承本地模式精度还不完全等同云端大模型,尤其冷门语言对)。

三、安装部署(重点)

项目完全免费开源,下载、安装、用自己的 Key 或用本地模型,都不需要注册账号。

3.1 部署前准备

系统要求(三端通用):64 位处理器、4GB 内存起(建议 8GB)、200MB 可用磁盘、麦克风 + 扬声器/耳机。

各平台的额外依赖(这是最容易踩坑的地方,先看好):

平台 需要什么
Windows Windows 10(1903+)或 11;VB-CABLE 虚拟声卡(安装程序会引导你装)
macOS macOS 10.15+;Apple Silicon 或 Intel;管理员权限(装音频驱动要用);需手动移除隔离属性
Linux PulseAudio 或 PipeWire 运行中,另需 pulseaudio-utils(提供 pactl 命令)

下载地址:

  • 官网下载页:https://sokuji.kizuna.ai/download
  • GitHub Releases:https://github.com/kizuna-ai-lab/sokuji/releases/latest
Sokuji 各平台安装包选择示意

安装包对照表:

平台 包名
Windows Sokuji-x.y.z.Setup.exe(另有便携版)
macOS(Apple Silicon) Sokuji-x.y.z-arm64.pkg
macOS(Intel) Sokuji-x.y.z-x64.pkg
Linux(Debian/Ubuntu x64) sokuji_x.y.z_amd64.deb
Linux(Debian/Ubuntu ARM64) sokuji_x.y.z_arm64.deb
Linux(通用) AppImage(x64 / arm64)

3.2 Windows 安装(含 VB-CABLE 这个大坑)

第 1 步:下载并运行安装程序

从 Releases 页面下载 .exe 安装包。若 Windows Defender SmartScreen 弹出拦截:

  1. 点击警告窗口上的 「更多信息」
  2. 窗口展开后,点击 「仍要运行」

说明:Sokuji 的 Windows 版本由 SignPath Foundation 提供免费代码签名(开源项目福利),但 SmartScreen 仍可能根据下载来源提示。遇到就按上面两步放行,不影响使用。

Windows 安装提示与 VB-CABLE 安装示意

第 2 步:安装 VB-CABLE 虚拟声卡

绕过 SmartScreen 后,安装程序会自动提示安装 VB-CABLE:

  1. 点击 「Install Now」 自动下载安装(也可以点「Download Manually」从 https://vb-audio.com/Cable/ 手动下)
  2. 弹出用户账户控制(UAC)时点 「是」
  3. VB-CABLE 安装程序打开后,点 「Install Driver」
  4. 等待安装完成,点 「OK」 确认,再点一次 「OK」 结束

第 3 步:验证 VB-CABLE 装好了

右键任务栏喇叭图标 → 「声音设置」,确认:

  • CABLE Output (VB-Audio Virtual Cable) 出现在录制设备里
  • CABLE Input (VB-Audio Virtual Cable) 出现在播放设备里

⚠️ 关键提示:你在 Sokuji 自己的设备列表里看不到这两个 CABLE 设备——这是官方刻意设计的。Sokuji 会隐藏它们以防你不小心选错造成音频回环(啸叫),并在后台自动检测使用 VB-CABLE。别去找,找不到是对的。

Windows 声音设置中检查虚拟音频设备

第 4 步:首次运行配置

VB-CABLE 装完后 Sokuji 会自动启动,进入音频配置页:

  1. 选择 AI 服务商(OpenAI / Gemini / 豆包 / Local Inference 等)
  2. 填入对应 API Key(选本地推理则跳过这步)
  3. 选择源语言和目标语言
  4. 测试音频输入输出设备
  5. Audio Input Device 选你的物理麦克风
  6. Virtual Speaker Monitor Device 选你的扬声器/耳机

点开始会话按钮,就能用了。


3.3 macOS 安装(Gatekeeper 是唯一的坑)

第 1 步:选对安装包

Apple 菜单 →「关于本机」看芯片:

  • 看到 Apple M1/M2/M3/M4 → 下 Sokuji-x.y.z-arm64.pkg
  • 看到 Intel → 下 Sokuji-x.y.z-x64.pkg

(包约 150–200MB,已内含虚拟音频驱动)

第 2 步:必须先移除隔离属性(不做这步一定装不上)

macOS 的 PKG 安装包没有签名(免费项目付不起苹果每年开发者账号的费用,官方在下载页把这事说得很坦白),所以首次安装会被 Gatekeeper 拦下。

打开终端(应用程序 → 实用工具 → 终端),执行:

<code class="language-bash"># Apple Silicon(把 x.x.x 换成你的实际版本号)
sudo xattr -d com.apple.quarantine ~/Downloads/Sokuji-x.x.x-arm64.pkg

# Intel Mac
sudo xattr -d com.apple.quarantine ~/Downloads/Sokuji-x.x.x-x64.pkg
</code>

输入管理员密码回车。没有输出就是成功了。

第 3 步:安装 PKG

  1. 双击 .pkg 文件
  2. 点「继续」→「安装」
  3. 输入管理员密码(装系统级音频驱动必须)
  4. 等 1–2 分钟完成,点「关闭」

这一步会装上三样东西:

  • Sokuji.app → /Applications
  • SokujiVirtualAudio.driver → /Library/Audio/Plug-Ins/HAL
  • 安装程序会自动重启 CoreAudio 加载驱动

第 4 步:首次启动

  1. 打开「应用程序」文件夹
  2. 右键(或 Control+点击)Sokuji → 选「打开」
  3. 弹窗中点「打开」确认

如果第 2 步的 xattr 命令执行正确,你可能根本看不到安全警告。若仍被拦:系统设置 → 隐私与安全性 → 通用 → 看到 Sokuji 被阻止的提示 → 点「仍要打开」。

第 5 步:配置

授予麦克风权限 → 选界面语言 → 选服务商 → 填 Key → 选源/目标语言 → 选音频设备(设备列表里应该能看到 Sokuji Virtual Audio)→ 测试麦克风和扬声器。


3.4 Linux 安装(最省心)

Linux 是三个平台里最省事的——虚拟麦克风由 Sokuji 自己通过 PulseAudio/PipeWire 创建,不需要额外装任何虚拟声卡驱动。

前置:确认音频服务器和工具

<code class="language-bash"># 确认 PulseAudio 或 PipeWire 在运行
pactl info | grep "Server Name"

# Debian/Ubuntu 若缺 pactl,先装工具包
sudo apt update && sudo apt install -y pulseaudio-utils
</code>

安装方式一:deb 包

<code class="language-bash"># x64 机器
sudo dpkg -i sokuji_x.y.z_amd64.deb

# ARM64 机器(如树莓派、部分 NAS)
sudo dpkg -i sokuji_x.y.z_arm64.deb

# 若提示依赖缺失,补一下
sudo apt -f install
</code>

安装方式二:AppImage(通用,不需要 root)

<code class="language-bash">chmod +x Sokuji-x.y.z.AppImage
./Sokuji-x.y.z.AppImage
</code>

3.5 浏览器扩展安装(最轻量,推荐先试)

如果你只用网页版会议(Google Meet、Teams 网页版、Zoom 网页版等),浏览器扩展是最快的上手方式——系统里什么都不用装,也不用折腾音频路由。

方式一:应用商店一键装(Chromium 116+)

  • Chrome:https://chromewebstore.google.com/detail/sokuji-extension/ppmihnhelgfpjomhjhpecobloelicnak
  • Edge:https://microsoftedge.microsoft.com/addons/detail/sokuji-ai-meeting-trans/dcmmcdkeibkalgdjlahlembodjhijhkm

方式二:开发者模式手动装

  1. 从 Releases 页面下载 sokuji-extension.zip 并解压
  2. 浏览器打开 chrome://extensions/,右上角开启**「开发者模式」**
  3. 点 「加载已解压的扩展程序」,选择解压出来的文件夹

扩展支持的平台:Zoom · Google Meet · Microsoft Teams(免费版/工作版/M365)· Slack · Discord · Jitsi Meet · Whereby · Gather Town · Yandex Telemost。

超出这个范围(本地软件、游戏、桌面端 OBS、浏览器外的视频),请用桌面端。


3.6 从源码构建(可选)

开源项目,想自己改或审查代码的话:

<code class="language-bash">git clone https://github.com/kizuna-ai-lab/sokuji.git
cd sokuji && npm install

npm run electron:dev        # 开发模式运行
npm run electron:build      # 生产构建
</code>

需要 Node.js(推荐最新 LTS 版)+ npm。


3.7 配置 AI 服务商:云端还是本地?

这是决定延迟和隐私的关键一步,两条路:

路线 A:本地推理(推荐先试这个)

  • 服务商选 Local Inference
  • 不需要 API Key、不需要联网、不需要独显
  • 首次使用时一键下载模型,缓存到浏览器 IndexedDB,之后完全离线
  • 适合:隐私敏感场景、想零成本试用、网络环境差

路线 B:云端大模型(精度更高)

  • 选 OpenAI / Gemini / 豆包 AST 2.0 / Soniox / Palabra.ai 等
  • 填入你自己的 API Key(也支持 OpenAI 兼容的自定义端点,仅桌面端)
  • 适合:追求翻译质量、冷门语言对、正式商务场合

国内用户建议:豆包 AST 2.0(火山引擎)支持中英双向且带声音克隆,延迟和合规性对国内更友好。


3.8 在会议软件里启用(最后一步)

  1. 打开 Zoom / Teams / Meet 的音频设置
  2. 把麦克风选为 Sokuji(或 Sokuji Virtual Microphone)
  3. 正常开始会议,开口说话——对方听到的就是翻译后的声音

想看对方说话的字幕?

  • 桌面端:直接采集系统音频,对方说的话会实时转成你语言的字幕(视频、直播、录音同理)
  • 浏览器扩展:读取当前标签页音频

想做真正的双语会议?

  • 开启双向模式,设好 Language A / Language B
  • 麦克风 + 系统音频同时采集,自动判断谁在说、说什么语言
  • 可以共享屏幕让对方也看到字幕

四、故障排查表

现象 原因 / 解决办法
Windows:SmartScreen 拦截安装 点「更多信息」→「仍要运行」
Windows:VB-CABLE 设备找不到 ① 重启电脑(大概率解决)② 声音设置里确认 CABLE Input/Output ③ 手动重装:从 vb-audio.com/Cable/ 下载解压,以管理员运行 VBCABLE_Setup_x64.exe,重启 ④ 设备管理器 →「声音、视频和游戏控制器」确认 VB-Audio Virtual Cable 无报错
Windows:在 Sokuji 里看不到 CABLE 设备 正常现象,官方刻意隐藏以防音频回环,后台自动使用,不用管
Windows:麦克风检测不到 设置 → 隐私 → 麦克风 → 开启「允许应用访问麦克风」,并确认 Sokuji 已勾选
Windows:应用起不来 右键以管理员运行 / 检查杀毒软件是否拦截 / 重装 / 更新系统
macOS:提示”套件已损坏,无法打开” 隔离属性没去掉,重跑:sudo xattr -d com.apple.quarantine ~/Downloads/Sokuji-*.pkg
macOS:提示”来自身份不明的开发者” 右键 Sokuji →「打开」→ 确认打开(只需一次)
macOS:虚拟音频驱动不显示 ① ls /Library/Audio/Plug-Ins/HAL/ 检查 ② 重启 CoreAudio:sudo killall coreaudiod ③ 系统设置 → 声音里看设备是否出现
macOS:Intel Mac 崩溃/卡顿 确认下的是 x64 而不是 arm64 版本;仍不行去 Console.app 查崩溃日志并提交 GitHub
Linux:虚拟麦克风没出现 确认 PulseAudio/PipeWire 在运行,且装了 pulseaudio-utils
无音频输出 检查系统输出设备是否选对、音量是否静音;在 Sokuji 里确认输出设备选择正确
翻译延迟高 换云端服务商;或本地模式换更小的模型(如 ASR 选 tiny/base 级别)

五、安全与隐私清单

发布和使用前,这几条值得留意:

  • ✅ 本地推理模式:音频 100% 在本机处理,零网络请求,这是隐私最优解。
  • ✅ 云模式:音频直连你选的服务商,Kizuna AI 不做中间服务器;API Key 仅存本地,不上传。
  • ⚠️ 匿名遥测:项目使用 PostHog 收集匿名使用统计(不含音频)。介意的话请自行评估。
  • ⚠️ macOS 未签名:官方坦承未签名(付不起苹果年费),需手动 xattr 去隔离属性。只从官方 GitHub Releases 或官网下载,别用第三方镜像。
  • ⚠️ 商用注意协议:项目为 AGPL-3.0。若你基于它做网络服务对外提供,AGPL 要求你同样开源——企业集成前请让法务过一眼。
  • ⚠️ 模型许可证:内置的第三方模型(Whisper、Piper、Opus-MT 等)各有自己的许可证,商用前查一下仓库里的 THIRD_PARTY_NOTICES.md。

六、一句话结论

Sokuji 的价值不在”又做了一个翻译器”,而在把同传这件事的摩擦降到了零——对方不用装、不用点、不用知道;你要么花几块钱接云端,要么干脆断网用本地模型,连音频都不用出公司。加上 AGPL 开源、三端通吃、虚拟麦克风随便接到任何软件,它大概是当前开源圈里完成度相当高的实时同传方案。


你平时跨国沟通最大的卡点是啥?是”不敢开口”、是”对方嫌装插件麻烦”、还是”公司不让传音频到第三方”?

评论区说说你的场景,我可以帮你判断走本地离线还是云端 + 自带 Key 更合适。

相关链接

  • 官网:https://sokuji.kizuna.ai/
  • 下载:https://sokuji.kizuna.ai/download
  • GitHub(AGPL-3.0):https://github.com/kizuna-ai-lab/sokuji
  • Windows 安装文档:https://sokuji.kizuna.ai/docs/install/windows
  • macOS 安装文档:https://sokuji.kizuna.ai/docs/install/macos
  • Chrome 扩展:https://chromewebstore.google.com/detail/sokuji-extension/ppmihnhelgfpjomhjhpecobloelicnak
  • Edge 扩展:https://microsoftedge.microsoft.com/addons/detail/sokuji-ai-meeting-trans/dcmmcdkeibkalgdjlahlembodjhijhkm
喜欢 (0)