
🧠 Speech Swift是什么?
Soniqo 是一个开源的端侧语音 AI SDK,主打 Apple Silicon(M1/M2/M3/M4),支持 macOS 和 iOS。它的核心信念很简单:语音 AI 应该在设备上运行,而不是在云端。
Apache 2.0 开源,完全离线,无需 API Key。安装只需要一行命令:
brew install speech
装完之后,你的 Mac 立刻拥有了以下能力:

Speech Swift 网站截图
🎯 三大核心能力
1️⃣ 语音转文字(ASR)—— 52 种语言,实时转录
基于 Qwen3-ASR 和 Parakeet TDT,支持从英语到印地语、从日语到阿拉伯语的 52 种语言。在 M2 Max 上,Qwen3-ASR-0.6B 的 RTF(实时因子)只有 0.06——也就是说,处理 1 秒音频只需要 0.06 秒,比 whisper.cpp 的 Whisper-large-v3 还要快 40%。
更夸张的是 Omnilingual ASR,支持 1,672 种语言,覆盖 32 种文字系统。世界上几乎所有有人说的语言,它都能听。
2️⃣ 文本转语音(TTS)—— 从 82M 轻量到 7B 全双工对话
Soniqo 提供了 10+ 种 TTS 引擎,按场景自由挑选:
- Kokoro-82M:82M 参数,CoreML 运行,170MB 模型,iOS 上也能流畅跑,54 种预设音色,适合 App 集成。
- Qwen3-TTS:最高质量,支持流式输出和自定义说话人,10 种语言。
- VibeVoice:能合成长达 90 分钟 的有声书/播客,中英文都支持。
- PersonaPlex 7B:全双工语音对话,你说它听,它说完你接,像真人聊天一样自然。
3️⃣ 声音克隆——5 秒参考,无限合成
只需 5-30 秒的参考音频,就能克隆一个声音并连续合成数小时。CosyVoice 3 + 说话人嵌入 + Apple Silicon 原生 MLX,全部在本地完成。你可以克隆自己的声音做播客,也可以克隆特定角色做配音——数据永远不会上传到任何服务器。
🔧 开发者友好到离谱
Soniqo 的 API 设计非常「Swift 原生」:
import Qwen3ASR
let model = try await Qwen3ASRModel.fromPretrained()
let text = model.transcribe(audio: audioSamples, sampleRate: 16000)
三行代码,搞定语音转文字。每个模型都是独立的 SPM 模块,按需导入,不用的模型不会增加包体积。
CLI 同样简洁:
speech transcribe recording.wav # 转录音频
speech speak “你好世界” –output hello.wav # 合成语音
speech-server –port 8080 # 启动本地 HTTP/WebSocket 服务器
speech speak “你好世界” –output hello.wav # 合成语音
speech-server –port 8080 # 启动本地 HTTP/WebSocket 服务器
🛡️ 为什么「端侧」很重要?
在云端语音服务大行其道的今天,Soniqo 坚持端侧运行有它的理由:
- 隐私零妥协:医生的问诊录音、律师的会议记录、创作者的灵感碎片——这些敏感数据不该经过任何第三方服务器。
- 成本零增长:没有按分钟计费,没有 API 调用次数限制。买一台 Mac,语音 AI 能力永久属于你。
- 延迟零等待:本地 Neural Engine 推理,不需要网络往返,响应速度是云端的数倍。
- 离线零依赖:飞机上、地铁里、信号盲区——只要有电,就能工作。
📱 不止 Mac,Android 和 Linux 也能跑
Soniqo 不是 Apple 独占。speech-android 提供 Kotlin API,基于 ONNX Runtime + NNAPI,支持 Android 8+;speech-core 提供 C++17 实现,面向嵌入式 Linux 和车载场景(Yocto、边缘设备)。同一套模型权重,针对不同平台做硬件加速优化——这才是「端侧」该有的样子。
🎯 适合谁?
- 独立开发者:想给 App 加语音功能,但不想被云端 API 的账单绑架。
- 播客/有声书创作者:批量生成内容,克隆自己的声音,保护嗓子。
- 隐私敏感行业:医疗、法律、金融——数据不出设备是硬要求。
- AI 爱好者:想亲手跑一个 7B 参数的语音对话模型,看看 Mac 的 Neural Engine 有多强。
📝 最后
Soniqo 让我想起了 Whisper 刚发布时的震撼——但这次,所有能力都跑到了你的设备上。没有 API Key,没有网络依赖,没有隐私焦虑。一台 M1 Mac,一行 brew install,你的电脑就拥有了听懂 52 种语言、克隆任意声音、合成 90 分钟有声书的能力。
相关导航

通义千问是由阿里云自主研发的超大规模语言模型。它不仅仅是一个能够聊天、回答问题的机器人,更是一个能够理解、分析并生成文字、图像、音频、视频及代码等多模态数据的全能智能助手。

AnyCoder
AnyCoder 是一个基于 Hugging Face 的全栈 AI 代码生成器。无论你是想做一个精美的网页、一个实用的 Python 工具,还是一个复杂的机器学习 Demo,你只需要用中文或英文描述你的需求,AnyCoder 就能实时为你“敲”出所有代码。
Embeddable
Embeddable 是一款专为嵌入式分析而生的全栈解决方案,帮助企业在自有产品或网站中快速打造 闪电般加载、深度定制 的交互式仪表盘和分析工具。
核心卖点
Headless 设计:前端完全可控,能够无缝匹配产品的 UI 风格,避免传统 BI 工具的 iframe 限制。
固定定价、无隐藏费用:采用统一的套餐计费模式,用户无需担心因用户数、仪表盘或查询次数产生额外费用,特别适合用户基数快速增长的企业。
权限粒度与多租户:内置行级安全(Row‑level security)和多租户支持,确保不同用户只能看到被授权的数据。
全方位图表库兼容:作为 headless SDK,可与任意 JavaScript/TypeScript 图表库(如 Chart.js、ECharts、D3 等)配合使用,提供业界最丰富的可视化选项。
低代码构建器:提供直观的无代码编辑器,业务团队无需写代码即可自行配置仪表盘和交互式工具,极大缩短上线周期。

SoundView
SoundView是一站式 AI 音视频本地化平台,它集 100+ 种语言自动翻译、字幕生成、语音克隆与音色模仿于一体,1 分钟视频 2 分钟可出成片

Hiring Agent
Hiring Agent是一款Resume-to-Score管道,能自动解析PDF简历、提取结构化信息、结合GitHub项目信号进行客观打分,并输出详细解释和证据,已收获数千Star,成为开发者与招聘者的高效利器。

OpenArt
OpenArt是一款基于生成式AI的创作平台,支持从文本或图像直接生成视频内容。用户只需输入简单的描述(Prompt),即可生成具有画面感、风格化的视频片段。
DeepSeek
DeepSeek是大模型搜索工具,基于自研训练框架、自建智算集群和万卡算力等资源,深度求索团队仅用半年时间便已发布并开源多个百亿级参数大模型,如DeepSeek-LLM通用大语言模型、DeepSeek-Coder代码大模型等。

Hermex
Hermex是一款免费、无内购的原生 iPhone 客户端,让你随时随地打开会话、实时流式响应、切换模型、附加文件、浏览工作空间,真正实现“服务器跑 Agent,手机来掌控”。
暂无评论...





