
🧠 Speech Swift是什么?
Soniqo 是一个开源的端侧语音 AI SDK,主打 Apple Silicon(M1/M2/M3/M4),支持 macOS 和 iOS。它的核心信念很简单:语音 AI 应该在设备上运行,而不是在云端。
Apache 2.0 开源,完全离线,无需 API Key。安装只需要一行命令:
brew install speech
装完之后,你的 Mac 立刻拥有了以下能力:

Speech Swift 网站截图
🎯 三大核心能力
1️⃣ 语音转文字(ASR)—— 52 种语言,实时转录
基于 Qwen3-ASR 和 Parakeet TDT,支持从英语到印地语、从日语到阿拉伯语的 52 种语言。在 M2 Max 上,Qwen3-ASR-0.6B 的 RTF(实时因子)只有 0.06——也就是说,处理 1 秒音频只需要 0.06 秒,比 whisper.cpp 的 Whisper-large-v3 还要快 40%。
更夸张的是 Omnilingual ASR,支持 1,672 种语言,覆盖 32 种文字系统。世界上几乎所有有人说的语言,它都能听。
2️⃣ 文本转语音(TTS)—— 从 82M 轻量到 7B 全双工对话
Soniqo 提供了 10+ 种 TTS 引擎,按场景自由挑选:
- Kokoro-82M:82M 参数,CoreML 运行,170MB 模型,iOS 上也能流畅跑,54 种预设音色,适合 App 集成。
- Qwen3-TTS:最高质量,支持流式输出和自定义说话人,10 种语言。
- VibeVoice:能合成长达 90 分钟 的有声书/播客,中英文都支持。
- PersonaPlex 7B:全双工语音对话,你说它听,它说完你接,像真人聊天一样自然。
3️⃣ 声音克隆——5 秒参考,无限合成
只需 5-30 秒的参考音频,就能克隆一个声音并连续合成数小时。CosyVoice 3 + 说话人嵌入 + Apple Silicon 原生 MLX,全部在本地完成。你可以克隆自己的声音做播客,也可以克隆特定角色做配音——数据永远不会上传到任何服务器。
🔧 开发者友好到离谱
Soniqo 的 API 设计非常「Swift 原生」:
import Qwen3ASR
let model = try await Qwen3ASRModel.fromPretrained()
let text = model.transcribe(audio: audioSamples, sampleRate: 16000)
三行代码,搞定语音转文字。每个模型都是独立的 SPM 模块,按需导入,不用的模型不会增加包体积。
CLI 同样简洁:
speech transcribe recording.wav # 转录音频
speech speak “你好世界” –output hello.wav # 合成语音
speech-server –port 8080 # 启动本地 HTTP/WebSocket 服务器
speech speak “你好世界” –output hello.wav # 合成语音
speech-server –port 8080 # 启动本地 HTTP/WebSocket 服务器
🛡️ 为什么「端侧」很重要?
在云端语音服务大行其道的今天,Soniqo 坚持端侧运行有它的理由:
- 隐私零妥协:医生的问诊录音、律师的会议记录、创作者的灵感碎片——这些敏感数据不该经过任何第三方服务器。
- 成本零增长:没有按分钟计费,没有 API 调用次数限制。买一台 Mac,语音 AI 能力永久属于你。
- 延迟零等待:本地 Neural Engine 推理,不需要网络往返,响应速度是云端的数倍。
- 离线零依赖:飞机上、地铁里、信号盲区——只要有电,就能工作。
📱 不止 Mac,Android 和 Linux 也能跑
Soniqo 不是 Apple 独占。speech-android 提供 Kotlin API,基于 ONNX Runtime + NNAPI,支持 Android 8+;speech-core 提供 C++17 实现,面向嵌入式 Linux 和车载场景(Yocto、边缘设备)。同一套模型权重,针对不同平台做硬件加速优化——这才是「端侧」该有的样子。
🎯 适合谁?
- 独立开发者:想给 App 加语音功能,但不想被云端 API 的账单绑架。
- 播客/有声书创作者:批量生成内容,克隆自己的声音,保护嗓子。
- 隐私敏感行业:医疗、法律、金融——数据不出设备是硬要求。
- AI 爱好者:想亲手跑一个 7B 参数的语音对话模型,看看 Mac 的 Neural Engine 有多强。
📝 最后
Soniqo 让我想起了 Whisper 刚发布时的震撼——但这次,所有能力都跑到了你的设备上。没有 API Key,没有网络依赖,没有隐私焦虑。一台 M1 Mac,一行 brew install,你的电脑就拥有了听懂 52 种语言、克隆任意声音、合成 90 分钟有声书的能力。
相关导航

Allmage Similarity Checker 是一款利用人工智能技术打造的在线图像相似度检测平台,能够快速、精准地对比两张图片的相似程度与差异。

Gorden PPT Skill
Gorden PPT Skill是一款专为 AI Agent 设计的原生 PPT 构建 Skill,基于 python-pptx 实现非破坏性文本替换,保留专业设计师手工打磨的排版、配色与布局,只替换文字内容,输出真正的 .pptx 文件。

AniFun AI
AniFun AI 是一款专为动漫、漫画与视频创作者打造的全功能 AI 创作平台,凭借“一键生成”式的操作体验,帮助用户在几分钟内完成从角色设定到完整漫画页、动画短片的全流程创作。

AIBanner
AIBanner是一款基于人工智能技术的在线横幅广告设计生成平台。它致力于帮助市场营销人员、创业者和企业主等用户,在无需专业设计经验的前提下,快速生成符合品牌风格的、专业级广告横幅。

Hermes Desktop
Hermes Desktop是一个真正能自我成长、长期记忆、跨平台陪伴你的自主 AI Agent,支持 macOS、Windows 和 Linux,让普通用户也能轻松驾驭这个强大 Agent。
FreeSubtitles.Ai
Freesubtitles.Ai 是一款面向视频创作者、翻译工作者和多语言用户的 AI 字幕生成平台。
改图鸭
改图鸭是一个集成化、多功能的在线图片处理平台。

谱乐AI
谱乐AI是一站式AI音乐创作平台,集AI音乐生成、混音、母带处理、人声克隆与替换以及音乐发行于一体,让人人都可以创作,人人都可以发行。
暂无评论...




