Home Assistant IA: Lo Esencial

Home Assistant IA: Lo Esencial

Home Assistant IA: Lo Esencial

Home Assistant IA: Lo Esencial para un Hogar Inteligente Potenciado

La inteligencia artificial (IA) ha permeado casi todos los rincones de la tecnología, y Home Assistant no es la excepción. En los últimos años, la comunidad de HA ha desarrollado un conjunto de funcionalidades impulsadas por IA verdaderamente fascinante. Desde asistentes de voz locales que operan enteramente en tu propio hardware hasta agentes conversacionales capaces de controlar tus dispositivos, redactar automatizaciones y responder preguntas sobre tu hogar.

Home Assistant IA: Lo EsencialHome Assistant IA: Lo Esencial

He estado utilizando las funcionalidades de IA en Home Assistant desde el lanzamiento de la Vista Previa de Voz, y mi opinión honesta es que ha avanzado enormemente. No es magia, y no reemplazará una configuración de automatización bien construida de la noche a la mañana. Pero para el control por voz, la depuración de YAML y para permitir que los miembros menos expertos en tecnología de tu hogar interactúen realmente con tu casa inteligente, cumple con creces.

Este es un desglose completo de todo lo que la IA en Home Assistant puede hacer, qué integraciones valen la pena configurar y cómo empezar sin complicarlo demasiado.

📣
¿Te interesan estas ofertas? Las publicamos primero en nuestro canal de Telegram10.247 miembros.

¿Qué es Home Assistant IA?

La IA en Home Assistant es un conjunto de funcionalidades en capas que trabajan juntas, donde cada capa cumple un propósito diferente adaptado a la forma en que eliges interactuar con tu hogar. Puede ser muy útil y beneficioso, pero también destructivo si no se utiliza correctamente.

Capas de Integración de IA de Home AssistantCapas de Integración de IA de Home Assistant
Capas de IA de Home Assistant. Imagen generada por Gemini
  1. La capa de voz es el pipeline de Asistencia. Maneja las palabras de activación, el reconocimiento de voz a texto, el procesamiento de intenciones y las respuestas de texto a voz. Es lo que permite el control por voz manos libres y puede ejecutarse completamente en tu hardware local.
  2. La capa de integración es donde residen los agentes conversacionales. Estos son modelos de IA, en la nube o locales, que conectas a Home Assistant y utilizas para controlar dispositivos, responder preguntas y generar automatizaciones. OpenAI, Gemini, Claude y Ollama se conectan aquí.
  3. La capa de automatización es para lo que la mayoría de la gente usa la IA. La IA puede ayudarte a escribir, depurar y refinar tu YAML directamente, ya sea a través de un agente conversacional conectado dentro de HA o mediante cualquier herramienta externa de IA en la que pegues tu configuración.
  4. La capa de Tareas de IA es una característica nativa más reciente de HA que permite que tus automatizaciones llamen directamente a modelos de IA. Puedes hacer cosas como analizar una instantánea de cámara, generar un mensaje de notificación o procesar datos de sensores en un formato estructurado. No se requiere indicación manual.
  5. La capa de configuración es el nivel más profundo. Herramientas emergentes como el servidor MCP de Home Assistant permiten que agentes de IA externos lean y escriban tu configuración de HA con contexto completo de tus dispositivos, áreas e historial de estado.

Estas capas se pueden usar de forma independiente. Por ejemplo, puedes usar Gemini como agente conversacional sin configurar nunca un pipeline de voz. Puedes ejecutar Whisper localmente para la voz sin conectar ninguna IA en la nube. Saber qué capa realmente deseas es el primer paso más útil.

¿Qué Puedes Hacer Realmente con IA en Home Assistant?

Antes de entrar en qué modelo usar y cómo configurarlo, vale la pena entender qué estás obteniendo realmente. La IA en Home Assistant no es solo para encender y apagar luces. El alcance es mucho más amplio de lo que la mayoría de las guías sugieren.

Comandos de Voz y Control de Dispositivos

Este es el caso de uso más obvio. Di un comando, tu hogar responde. Con un pipeline de Asistencia bien configurado, puedes controlar cualquier entidad expuesta, preguntar sobre el estado de los dispositivos, activar escenas y ejecutar scripts. El lenguaje natural significa que no estás atado a una sintaxis rígida. “Apaga todo en el dormitorio excepto el ventilador” es un comando válido si tu agente conversacional está configurado correctamente.

Gestión de Automatizaciones, Scripts y Dashboards

Aquí es donde la IA se gana su lugar para los usuarios avanzados. Un agente conversacional conectado a Home Assistant puede crear automatizaciones a partir de una descripción en lenguaje natural, agregar nuevas tarjetas al dashboard, construir scripts para secuencias complejas y ayudarte a gestionar ayudantes y entidades de entrada. Pídele que cree una automatización de “modo cine” que atenúe las luces, cierre las persianas y encienda el televisor, y un modelo capaz producirá YAML funcional listo para aplicar. El editor de automatizaciones todavía existe, pero diría que el atajo de IA es real en este punto.

📣
¿Te interesan estas ofertas? Las publicamos primero en nuestro canal de Telegram10.247 miembros.

Monitorización y Consulta de tu Hogar con IA

Más allá del control, los modelos de IA conectados pueden consultar el estado de tu hogar y darte resúmenes útiles. ¿Qué dispositivos están activos actualmente? ¿Qué luces han estado encendidas por más de dos horas? ¿Hay presencia humana en la sala de estar en este momento? Estas son preguntas que un agente conversacional puede responder si tiene acceso de lectura a tus entidades. Algunos usuarios también envían instantáneas de cámaras a modelos multimodales como Gemini para obtener descripciones en lenguaje natural de lo que la cámara ve, lo que abre algunas posibilidades interesantes de automatización de notificaciones.

Gestión y Configuración del Sistema

En un nivel más profundo, la IA puede ayudarte a gestionar la capa de configuración del propio Home Assistant. Crear áreas y zonas, registrar nuevos dispositivos, gestionar el registro de dispositivos, revisar rastreos de automatización para depuración, verificar la salud de los complementos de Home Assistant y manejar copias de seguridad. Este nivel de capacidad es donde entra en juego el servidor MCP de Home Assistant, que expone una interfaz mucho más completa para que los agentes de IA lean y escriban directamente tu configuración de HA.

En resumen, convierte tu instancia de Home Assistant en un servidor MCP (Model Context Protocol), permitiendo que clientes de IA externos como Claude Desktop se conecten directamente a tu hogar, consulten el estado de los dispositivos y activen acciones. Ese es un tema que merece su propio artículo dedicado, pero es importante saber que existe.

Pipeline de Voz de Home Assistant Explicado

El pipeline de Asistencia de Home Assistant maneja el lado “cerebro” del control por voz. El hardware satélite se encarga de los “oídos” y la “boca”. Estos son los dos componentes físicos que necesitas para el control por voz manos libres en cualquier habitación.

Antes de entrar en Whisper y los modelos de IA externos, vale la pena saber que la voz de Home Assistant funciona lista para usar sin ninguno de ellos. Asistencia tiene un motor de reconocimiento de intenciones local incorporado basado en oraciones y patrones. Dices “apaga las luces de la cocina” y HA empareja esa frase con la acción correcta localmente, sin dependencia de la nube y sin necesidad de ningún modelo de IA.

Cubre los comandos más comunes de manera confiable y es con lo que la mayoría de las personas deberían empezar. Los agentes conversacionales de IA descritos anteriormente en este artículo solo entran en juego cuando deseas ir más allá de los patrones de frases fijas, hacer preguntas complejas, generar automatizaciones o manejar comandos que el motor incorporado no reconoce.

Whisper y Piper para el Procesamiento Local de Voz

Whisper maneja el reconocimiento de voz a texto. Es el modelo de código abierto de OpenAI, disponible como un complemento de Home Assistant, y se ejecuta completamente en tu servidor. Piper maneja el texto a voz, generando la respuesta de voz que reproduce tu satélite. Ambos se comunican con Home Assistant a través del protocolo Wyoming, una API local ligera que conecta los componentes de voz.

Ejecuto Home Assistant en un Beelink Mini PC con un Intel N305, y todo el pipeline se ejecuta localmente sin ningún retraso notable una vez que está correctamente configurado. El tamaño del modelo Whisper es la principal compensación. Los modelos más grandes son más precisos pero más lentos de procesar. En el N305, los modelos más rápidos funcionan bien para comandos simples. Si estás en una Raspberry Pi, quédate con el modelo Whisper “tiny” o “base” y acepta cierta pérdida de precisión en frases complejas.

Procesamiento de Voz en la Nube de Home Assistant

Si prefieres no ejecutar Whisper localmente, Home Assistant Cloud a través de Nabu Casa incluye reconocimiento de voz a texto y texto a voz en la nube como parte de la suscripción. La calidad es notablemente mejor que Whisper local en hardware modesto, y la configuración es el camino más fácil posible. La contrapartida es que tus comandos de voz salen de tu red.

La misma suscripción también te brinda integración fácil con dos clics con Google Assistant y Amazon Alexa si ya estás en esos ecosistemas, aunque la mayoría de los usuarios de HA se están alejando de la voz de las grandes tecnológicas en lugar de acercarse a ella.

Palabras de Activación Personalizadas de Home Assistant

Las palabras de activación son las que hacen que tu asistente de voz comience a escuchar. De fábrica, Home Assistant viene con un puñado de opciones incorporadas que incluyen “Okay Nabu”, “Hey Jarvis” y “Hey Mycroft”. Funcionan, pero si deseas algo que realmente se sienta tuyo, Home Assistant te permite entrenar y desplegar una palabra de activación completamente personalizada. Es una de las características más infravaloradas en toda la pila de voz.

Entrenar una Palabra de Activación Personalizada con openWakeWord

Por defecto, Home Assistant utiliza openWakeWord como su motor de palabras de activación. Lo que lo hace inteligente es el enfoque de entrenamiento. En lugar de requerir que grabes cientos de muestras de voz tú mismo, genera miles de clips de audio sintéticos usando Piper, y luego los ejecuta a través del modelo de incrustación de audio de Google para construir el modelo de detección. Todo el proceso de entrenamiento se ejecuta en Google Colab utilizando recursos de cómputo gratuitos. No necesitas una máquina local potente ni experiencia en aprendizaje automático.

Como algunos de ustedes ya sabrán, soy un gran fan de El Señor de los Anillos. Tengo figuras de LOTR impresas en 3D alrededor de mi escritorio y mi palabra de activación personalizada de PE de voz es Sauron. Como el Señor Oscuro en persona.

Lo pronuncio deliberadamente como “saur-on” con una pausa clara entre sílabas, y funciona cada vez. Decir “Sauron, apaga las luces del salón” nunca pasa de moda. Lo triste es que parece que soy el único que lo disfruta.

El truco está en que debe pronunciarse correctamente y con cierta convicción. Nadie más en mi hogar puede activarlo de forma fiable, lo que es un error o una característica dependiendo de cómo se mire. No hay activaciones falsas, lo que no se puede decir de “Hey Google”.

Home Assistant IA Custom Wake Word Sauron SmartHomeSceneHome Assistant IA Custom Wake Word Sauron SmartHomeScene

En la práctica, abres el notebook de Colab, escribes tu palabra de activación, pruebas cómo suena, esperas aproximadamente una hora y descargas un archivo de modelo. Lo colocas en Home Assistant, lo asignas a tu asistente de voz, y listo. Mi primera versión todavía tiene margen de mejora, y existe la opción de afinarla aún más grabando tu propia voz a través del satélite. Eso está en mi lista de tareas pendientes.

Usando microWakeWord como una Alternativa en Dispositivo

microWakeWord es un modelo más ligero basado en la arquitectura de red neuronal Inception de Google. Debido a que es más pequeño, puede ejecutarse directamente en hardware ESP32-S3 como el S3-BOX-3, realizando la detección de la palabra de activación en el dispositivo en lugar de transmitir audio al servidor. Esto reduce el tráfico de red y la carga de CPU en tu instancia de Home Assistant. Si estás ejecutando múltiples satélites de voz, microWakeWord vale la pena considerarlo.

Sin embargo, las compensaciones son reales. microWakeWord actualmente solo viene con palabras de activación preentrenadas y no admite el entrenamiento de palabras de activación personalizadas como lo hace openWakeWord. Cambiar la palabra de activación predeterminada requiere editar tu configuración ESPHome y recompilar el firmware. El modelo también es menos preciso que openWakeWord en promedio, y requiere específicamente un chip ESP32-S3. Vale la pena señalar que la gente también ejecuta microWakeWord con éxito en el Home Assistant Voice PE, aunque requiere algo de ingenio.

Satélites de Voz de Home Assistant y el Voice PE

El hardware satélite es lo que lleva el control por voz a cada habitación. Maneja la entrada del micrófono y la salida del altavoz, mientras que todo el procesamiento pesado ocurre en tu servidor de Home Assistant. Cualquier dispositivo basado en ESP32-S3 flasheado con el firmware de asistente de voz de ESPHome puede actuar como satélite, siendo el ESP32-S3-BOX-3 el favorito actual de la comunidad por su calidad de audio y su conjunto de micrófonos direccionales.

El Home Assistant Voice PE es el propio hardware satélite de Nabu Casa. Es exactamente lo que dice el nombre, una vista previa. Nabu Casa ha sido transparente al respecto desde el principio, y debes tener las expectativas correctas. La calidad del audio no es premium. Captura comandos, funciona de manera fiable una vez configurado correctamente, pero no lo confundirías con un Amazon Echo en términos de calidad de micrófono.

Home Assistant Voice PEHome Assistant Voice PE
Home Assistant Voice PE

Dicho esto, por el precio y para lo que está diseñado, proporcionar a la comunidad un dispositivo estandarizado para probar las funciones de voz de Home Assistant, cumple su propósito. Tengo dos dispositivos Voice Preview. Uno en la sala de estar que uso a diario, y otro en mi escritorio de oficina para probar y experimentar con nuevas funciones.

Integraciones de IA de Home Assistant

Home Assistant soporta oficialmente varias integraciones de agentes conversacionales de IA listas para usar. Cada una tiene diferentes compromisos en cuanto a costo, privacidad y capacidad. Aquí tienes el panorama completo a mayo de 2026.

¿Cuánto es 1 millón de tokens en la práctica?

Una interacción única, enviar un comando, hacer una pregunta o solicitar una automatización, generalmente utiliza entre 500 y 2000 tokens, incluido el contexto enviado al modelo. Para ponerlo en perspectiva, podrías tener entre 500 y 2000 intercambios de ida y vuelta por cada dólar gastado. Para la mayoría de las personas que usan la IA ocasionalmente para controlar dispositivos o depurar automatizaciones, una factura mensual de unos pocos centavos a uno o dos dólares es realista.

Dicho esto, el uso real varía mucho según cómo configures las cosas. Por ejemplo, el número de entidades que expones al modelo es un factor importante. Un agente conversacional con acceso a 200 entidades envía un contexto mucho más grande con cada solicitud que uno limitado a 20. El modelo en sí también importa, ya que algunos utilizan más tokens internamente para razonar una respuesta que otros. Comienza con la exposición mínima de entidades y amplía solo según sea necesario.

OpenAI en Home Assistant

La integración de OpenAI es la opción más antigua y probada en batalla. El modelo predeterminado en Home Assistant es gpt-4o-mini, que sigue siendo una de las opciones más rentables con un costo de $0.15 por millón de tokens de entrada y $0.60 por millón de tokens de salida.

gpt-4.1-mini es la alternativa nueva y recomendada a $0.40/$1.60, que ofrece un mejor seguimiento de instrucciones y una ventana de contexto mucho más grande. Ambas funcionan bien para el control del hogar y la generación de automatizaciones. Si deseas la opción más barata para comandos de control del hogar simples, gpt-4.1-nano a $0.10/$0.40 por millón de tokens vale la pena considerarla.

Cabe destacar: la integración de OpenAI solo funciona con el punto final oficial de la API de OpenAI. No admite servicios de terceros compatibles con OpenAI. Para eso, usa OpenRouter en su lugar.

Google Gemini en Home Assistant

Gemini es lo que usé durante mucho tiempo, configurado principalmente para ver cómo se comportaba en un entorno HA real. La respuesta honesta es que funciona, con una pequeña molestia: retrasos ocasionales de hasta diez segundos antes de que llegue una respuesta. No siempre, pero lo suficiente como para ser notable. Cuando responde rápidamente, es preciso y rara vez malinterpreta los comandos.

Los modelos recomendados actualmente son Gemini 3 Flash a $0.50 por millón de tokens de entrada y Gemini 3.1 Flash-Lite a $0.25, ambos conservan un nivel gratuito con límites de tasa. Gemini 2.5 Flash está programado para su depreciación el 17 de junio de 2026, así que evita configurarlo como tu modelo en una nueva integración. El nivel gratuito a través de Google AI Studio sigue siendo el punto de entrada más fácil sin costo. Genera una clave en ai.google.dev, pégala en la integración y listo.

Anthropic Claude en Home Assistant

Claude tiene una integración oficial en Home Assistant, listada como “Anthropic” en la lista de integraciones. Admite toda la familia de modelos actual. Haiku 4.5 es la opción económica a $1.00 por millón de tokens de entrada y $5.00 por millón de tokens de salida. Sonnet 4.6 a $3.00/$15.00 es la opción equilibrada. Opus 4.7 a $5.00/$25.00 es el más capaz pero difícil de justificar para casos de uso de control del hogar donde Sonnet ya maneja todo bien.

No hay nivel gratuito para Claude. Anthropic requiere una clave API con facturación habilitada desde el principio, aunque los costos para el uso típico de automatización del hogar son bajos.

Ejecución de IA Localmente con Ollama

Ollama te permite ejecutar modelos de lenguaje grandes completamente en tu propio hardware. La integración de Ollama de Home Assistant está integrada de forma nativa y se conecta a un servidor Ollama que se ejecuta en tu red local. Ningún dato sale de tu casa.

Los modelos populares para uso en HA incluyen Llama 3.1 8B, Qwen3 4B, Mistral Small y Phi-4. El requisito de hardware es la verdadera limitación. 8GB de RAM te permiten acceder a los modelos más pequeños de clase 4B, 16GB abre el rango de 8B, y cualquier cosa más grande necesita considerablemente más. La propia documentación de Home Assistant señala que los modelos más pequeños pueden tener dificultades para controlar dispositivos de manera fiable, así que prueba tu modelo elegido antes de depender de él para algo crítico.

No he probado Ollama en mi propia configuración, pero los resultados de la comunidad son sólidos para los comandos de control del hogar en los modelos más pequeños.

OpenRouter en Home Assistant

OpenRouter se convirtió en una integración nativa oficial de HA en 2025.8 y es, posiblemente, la opción más flexible de esta lista. Te da acceso a más de 400 modelos a través de una única clave API, con la facturación gestionada por OpenRouter. Esto incluye modelos de OpenAI, Anthropic, Google, Meta, Mistral y muchos otros, así como algunos modelos alojados completamente gratuitos.

La principal ventaja sobre las integraciones individuales es que puedes cambiar de modelo sin cambiar tu configuración de HA, y puedes acceder a modelos que no tienen su propia integración nativa de HA. Si deseas experimentar con DeepSeek, Qwen o cualquier número de modelos abiertos sin configurar Ollama localmente, OpenRouter es el camino más fácil. También admite Tareas de IA desde el primer día, al igual que las integraciones nativas.

IA Local vs. Nube en Home Assistant: ¿Cuál Deberías Usar?

La elección se reduce a cuatro cosas: privacidad, costo, calidad de respuesta y hardware.

La IA local mantiene todo en tu red. Ningún clip de voz enviado a Google, ninguna consulta de automatización registrada por OpenAI. Para un sistema doméstico que te escucha constantemente, eso importa a mucha gente. La contrapartida es la inversión en hardware y una cierta pérdida de calidad en máquinas modestas.

Por otro lado, la IA en la nube es más fácil de configurar, generalmente más precisa y no requiere recursos locales más allá de una conexión de red. La contrapartida es el costo continuo para servicios basados en API y el hecho de que tus datos salen de tu hogar.

Mi opinión honesta: la IA no reemplaza una configuración de automatización bien construida. Si conoces el editor de HA y tienes tus dispositivos organizados, no necesitarás repentinamente un agente de IA funcionando constantemente. Donde se gana su lugar es en ahorrar tiempo al escribir y depurar automatizaciones, y en hacer que el control por voz sea realmente utilizable para las personas en tu hogar.

Cómo Empezar con la IA de Home Assistant

Realmente hay dos maneras en que las personas abordan la IA de Home Assistant. Algunos quieren una capa completa de voz y conversación, un hogar inteligente al que realmente puedan hablar. Otros solo quieren ayuda para resolver problemas, arreglar automatizaciones rotas o construir algo más complejo de lo que quieren escribir desde cero. Ambas son válidas, y el camino de configuración es diferente para cada una. Aquí es donde empezar.

Para control por voz y agentes conversacionales:

  1. Elige un dispositivo satélite de voz. El ESP32-S3-BOX-3 es la opción recomendada actual para una mejor calidad de audio y soporte de palabras de activación en el dispositivo. El Voice Preview es el hardware oficial de Nabu Casa si deseas algo plug-and-play.
  2. Conecta tu dispositivo a Home Assistant. Algunos dispositivos como el Voice Preview son plug-and-play. Otros como el ESP32-S3-BOX-3 pueden requerir flashear el firmware ESPHome primero a través del instalador basado en navegador en esphome.io.
  3. Configura un pipeline de Asistencia. Home Assistant Cloud es el camino más fácil. Para una configuración totalmente local, utiliza el complemento Whisper para voz a texto y Piper para texto a voz.
  4. Elige un agente conversacional. Por defecto, Asistencia maneja comandos localmente usando su propio reconocimiento de intenciones incorporado, que funciona bien para el control estándar de dispositivos. Si deseas ir más allá de los comandos fijos, Gemini en el nivel gratuito de Google AI Studio es la adición más fácil. OpenAI, Claude y Ollama también funcionan aquí.
  5. Elige una palabra de activación. Home Assistant viene con “Okay Nabu”, “Hey Jarvis” y “Hey Mycroft” listos para usar. Si deseas algo más personal, puedes entrenar una palabra de activación completamente personalizada usando openWakeWord y Google Colab en aproximadamente una hora.
  6. Prueba el pipeline completo de principio a fin antes de cambiar cualquier otra cosa. Di un comando, confirma que el satélite lo capta y verifica que Home Assistant responde correctamente.

Para ayuda con automatizaciones, depuración y gestión del sistema:

  1. Empieza fuera de Home Assistant. Copia tu YAML de automatización, pégalo en cualquier herramienta de chat de IA, describe lo que quieres que haga o qué está roto, y pega el resultado de vuelta. Esto por sí solo cubre la mayoría de los casos de uso y no requiere configuración alguna.
  2. Agrega un agente conversacional si deseas IA dentro de Home Assistant. Ve a Ajustes, Dispositivos y Servicios, y agrega tu integración preferida. Gemini en el nivel gratuito o Claude Haiku son buenos puntos de partida por costo y calidad.
  3. Limita la exposición de entidades. Dale a la IA acceso solo a las entidades y áreas relevantes para tu caso de uso. Menos contexto para empezar, no más.
  4. Profundiza con el servidor MCP. El servidor MCP de Home Assistant otorga a los agentes de IA externos acceso de lectura y escritura a tu configuración completa de HA, incluidas automatizaciones, scripts, ayudantes, dashboards y el registro de dispositivos. Trátalo como acceso de producción y haz siempre una copia de seguridad antes de usarlo.

En última instancia, la IA de Home Assistant no es un destino al que tengas que llegar solo porque todo el mundo habla de ello. Piénsalo como un conjunto de herramientas que agregas a medida que las necesitas. Comienza con una capa, ponte cómodo y construye a partir de ahí. La hermosa comunidad de Home Assistant ha hecho la mayor parte del trabajo duro. Antes de sumergirte en la IA, consulta la guía de Fundamentos de Home Assistant.