跳到主要内容
MACT.ai
全部案例

AI 语音设备

低成本 ESP32 音箱:唤醒词在端侧,对话在云端。

2026ESP32 · 语音 AI · 云端
AI 语音设备

项目概览

一个刻意建在廉价 MCU 上的语音产品。唤醒词检测与音频前端处理在本地完成;流式语音识别、语言模型与语音合成跑在 AI 网关后面。

挑战

在一颗可用 RAM 只有几百 KB 的芯片上,通过家用 Wi-Fi 让对话延迟感觉是即时的,而且单机成本不能把产品做死。

方案

我们做了双向音频流,拿到第一段合成音频就开始播放,而不是等完整回复。本地唤醒词与回声消除让射频在真正需要之前保持安静。

架构

01

硬件

ESP32-S3 搭配双麦克风阵列、I2S 编解码器与功放,做在一块紧凑的四层板上。

  • 双麦阵列,带波束成形前端
  • I2S 编解码器与 D 类功放
  • 四层板,严格遵守天线净空规则
  • USB-C 供电,可选电池方案
02

AI

端侧唤醒词与语音活动检测,流式 ASR、LLM 与 TTS 通过网关接入。

  • 唤醒词占用 RAM 不到 100 kB
  • 声学回声消除与噪声抑制
  • 流式 ASR,输出中间假设
  • 首段音频输出约 700 ms
03

软件

ESP-IDF 固件,带 WebSocket 会话协议、配网流程与 OTA,后面是无状态会话服务。

  • 单条 WebSocket 承载双向音频
  • Opus 编码以适配家用上行带宽
  • BLE 配网,带 captive 兜底
  • 签名 OTA,分批下发

结果

  • 首段语音输出约 700 ms
  • 唤醒词跑在 MCU 的内存预算之内
  • 更换模型供应商不需要发固件
  • BOM 控制在目标价格之内

技术栈

硬件

ESP32-S3Mic ArrayI2S Audio

AI

Wake WordStreaming ASRLLMTTS

嵌入式

ESP-IDFOpusWebSocketOTA

云端

AI GatewaySession Service