Ir al contenido
MACT.ai
Todos los proyectos

Dispositivo de voz con IA

Un altavoz ESP32 de bajo costo con palabra de activación en el dispositivo y conversación en la nube.

2026ESP32 · IA de voz · Nube
Dispositivo de voz con IA

Resumen del proyecto

Un producto de voz construido sobre un MCU deliberadamente económico. La detección de la palabra de activación y el procesamiento del front end de audio se ejecutan localmente; el reconocimiento de voz en streaming, el modelo de lenguaje y la síntesis de voz corren detrás de una pasarela de IA.

Reto

La latencia conversacional tenía que sentirse inmediata en un chip con unos pocos cientos de kilobytes de RAM utilizable, sobre Wi-Fi doméstico y sin un costo por unidad que rompiera el producto.

Solución

Transmitimos audio en ambas direcciones y arrancamos la reproducción con el primer fragmento sintetizado en lugar de esperar la respuesta completa. La palabra de activación local y la cancelación de eco mantuvieron la radio en silencio hasta que hacía falta.

Arquitectura

01

Hardware

Un ESP32-S3 con un array de dos micrófonos, códec I2S y amplificador en una placa compacta de 4 capas.

  • Array de dos micrófonos con front end de beamforming
  • Códec I2S y amplificador clase D
  • Placa de 4 capas con disciplina de keep-out de antena
  • Alimentación USB-C con opción de batería
02

IA

Palabra de activación y detección de actividad de voz en el dispositivo, con ASR en streaming, un LLM y TTS a través de una pasarela.

  • Palabra de activación en menos de 100 kB de RAM
  • Cancelación acústica de eco y supresión de ruido
  • ASR en streaming con hipótesis parciales
  • Primer audio de salida en unos 700 ms
03

Software

Firmware ESP-IDF con un protocolo de sesión sobre WebSocket, flujo de aprovisionamiento y OTA, detrás de un servicio de sesiones sin estado.

  • Audio bidireccional sobre un único WebSocket
  • Codificación Opus para caber en enlaces de subida domésticos
  • Aprovisionamiento BLE con portal cautivo de reserva
  • OTA firmado con despliegue por fases

Resultado

  • Unos 700 ms hasta el primer audio hablado
  • Palabra de activación dentro del presupuesto de memoria del MCU
  • Proveedores de modelos intercambiables sin publicar firmware
  • Lista de materiales contenida dentro del precio objetivo

Stack tecnológico

Hardware

ESP32-S3Mic ArrayI2S Audio

IA

Wake WordStreaming ASRLLMTTS

Embebido

ESP-IDFOpusWebSocketOTA

Nube

AI GatewaySession Service