Inteligencia Artificial (IA)

¿Qué es la IA en el borde? Ejemplos y beneficios de la computación en el borde

Lectura de 13 minutos

La inferencia de IA es el proceso de utilizar un modelo de IA entrenado para generar una predicción, respuesta u otro resultado a partir de nuevos datos. La IA en el borde ejecuta la inferencia de IA en dispositivos o infraestructura cercanos a donde se crean los datos en lugar de enviar cada solicitud a la nube. Eso significa que el modelo, el entorno de ejecución y los datos que necesita residen en la fuente o cerca de ella (por ejemplo, en un teléfono, un sensor, un quiosco, una pasarela industrial o un servidor de borde) en lugar de en un centro de datos distante.

Los proveedores de hardware explican la inteligencia artificial en el borde en términos de chips y aceleradores. Los proveedores de la nube la explican en términos de modelos de implementación. Esta publicación cubre ambos aspectos, además de la parte que la mayoría de los proveedores omite. También aprenderá lo que las aplicaciones de inteligencia artificial en el borde realmente necesitan de su capa de datos, y por qué esa capa determina si la aplicación satisface las necesidades comerciales en el mundo real.

¿Cómo funciona la IA perimetral?

La IA en el borde sigue el mismo flujo de trabajo central sin importar dónde se implemente:

  1. Tren el modelo, típicamente en la nube o en un centro de datos donde los recursos de computación son abundantes y los conjuntos de datos de entrenamiento son grandes.
  2. Comprimir y cuantizar el modelo para reducir su tamaño y uso de memoria para que pueda ejecutarse en hardware limitado en el borde.
  3. Implementar el modelo comprimido al dispositivo de destino, puerta de enlace o servidor perimetral.
  4. Ejecutar inferencia local en ese dispositivo utilizando datos entrantes sin requerir un viaje de ida y vuelta a la nube.

El hardware que ejecuta la inferencia local ha evolucionado rápidamente. Las unidades de procesamiento neuronal (NPU), las GPU móviles y los aceleradores de IA de empresas como Qualcomm, Apple y NVIDIA ahora hacen que la inferencia sea rápida y eficiente en dispositivos que habrían sido inadecuados para cargas de trabajo de IA hace apenas unos años.

Si bien algunos despliegues avanzados realizan un ajuste fino local y ligero, la inferencia sigue siendo la carga de trabajo principal en el borde. El entrenamiento del modelo base se mantiene donde abunda la computación, en la nube o en el centro de datos.

IA en el borde vs. IA en la nube

La mayoría de los despliegues de producción combinan el borde y la nube en lugar de elegir uno exclusivamente. Un patrón común ejecuta la inferencia en el borde para mayor velocidad y capacidades sin conexión, mientras utiliza la nube para el entrenamiento de modelos, análisis pesados, agregación de datos y gobernanza.

Aquí hay algunas diferencias clave entre la inteligencia artificial en el borde y en la nube:

IA en el bordeIA en la nube
Dónde se ejecuta la inferenciaEn el dispositivo, puerta de enlace o servidor de bordeCentro de datos en la nube centralizado
LatenciaDe menos de un milisegundo a unos pocos milisegundosAgrega la ida y vuelta de la red (de decenas a cientos de milisegundos)
Dependencia de la conectividadPuede funcionar completamente sin conexiónRequiere una conexión de red estable
Privacidad de datosLos datos confidenciales permanecen localesLos datos viajan hacia la nube y se almacenan en ella
Calcular el techoLimitado por el hardware localPrácticamente ilimitado
Modelo de costosCostos iniciales de hardware, menores costos continuos de salida de datosCostos operativos continuos de cómputo, uso de API, almacenamiento y transferencia de red

IA en el borde vs. computación en el borde

Computación en el borde es un patrón arquitectónico que acerca el procesamiento y el almacenamiento al lugar donde se crean los datos, en lugar de centralizar todo en la nube. La IA en el borde es la carga de trabajo de IA que se ejecuta en esa arquitectura. En otras palabras, la computación en el borde es la infraestructura, mientras que la IA en el borde es lo que se ejecuta en ella. Se puede tener computación en el borde sin IA, pero la IA en el borde siempre requiere computación en el borde.

IA en el borde frente a IA en el dispositivo

En el dispositivo La IA en el dispositivo es la forma más estricta de IA en el borde (Edge AI), con el modelo ejecutándose completamente en el propio dispositivo final. No hay dependencia de una puerta de enlace cercana ni de un servidor de borde. La IA en el borde es la categoría más amplia, que abarca tanto las implementaciones en el dispositivo como los servidores de borde y las puertas de enlace cercanas que procesan datos de múltiples dispositivos.

IA en el borde frente a IA local

La IA local ejecuta la inferencia en el propio centro de datos de una organización, manteniendo los datos fuera de la nube pública. La IA en el borde distribuye la inferencia al lugar donde se realiza el trabajo (por ejemplo, dispositivos, pasarelas y sitios locales), a menudo en entornos sin conectividad confiable a un centro de datos central. 

Aunque tanto la IA local como la IA en el borde mantienen los datos fuera de la infraestructura pública, resuelven problemas diferentes. La IA local aborda la gobernanza y el control en un modelo centralizado. La IA en el borde aborda el requisito de operar de manera confiable cuando los dispositivos y los sitios no pueden depender de un viaje de ida y vuelta al centro de datos.

Beneficios de la IA en el borde

Baja latencia: Debido a que la inferencia se ejecuta localmente, no hay ida y vuelta de red que agregue retraso. Las aplicaciones que necesitan resultados en tiempo real (por ejemplo, sistemas de asistencia al conductor, monitoreo de seguridad industrial, traducción en vivo) obtienen tiempos de respuesta de fracciones de milisegundo a pocos milisegundos que la inferencia en la nube no puede igualar de manera confiable.

Privacidad y seguridad: Los datos confidenciales permanecen en el dispositivo o dentro de la infraestructura local. No se transmiten por internet ni se almacenan en un entorno de nube compartido. Esto es de suma importancia para la salud, los servicios financieros y cualquier aplicación que maneje información personal.

Operación sin conexión: Las aplicaciones de inteligencia artificial en el borde (Edge AI) pueden seguir funcionando cuando se interrumpe la conectividad, siempre y cuando el modelo, el entorno de ejecución y los datos necesarios estén disponibles localmente. Para los trabajadores de servicio de campo, las tiendas minoristas, las plantas de producción y los vehículos, este es un requisito esencial.

Ahorro de ancho de banda y costos: Al procesar datos localmente, la inteligencia artificial en el borde reduce el volumen de datos transmitidos a la nube, disminuye los costos de salida y reduce la presión sobre las redes compartidas. Para las implementaciones de IoT que generan datos de sensores de alto volumen, estos ahorros son sustanciales. Sin embargo, recuerde que los costos de la nube y del tiempo de ida y vuelta (RTT) pueden ser prohibitivos para otros tipos de aplicaciones.

Casos de uso y ejemplos de Inteligencia Artificial en el borde (Edge AI)

Minorista

Los quioscos inteligentes que ejecutan recomendaciones personalizadas, los sistemas de cámaras en las tiendas que rastrean el movimiento de los clientes con fines de inventario y las terminales de punto de venta que siguen procesando transacciones durante cortes de conectividad son casos de uso prácticos de la IA en el borde (edge AI). La operación sin conexión es especialmente crítica para los POS minoristas porque cada transacción fallida equivale a una pérdida de ingresos.

El cumplimiento de los planogramas minoristas es otro caso de uso de IA en el borde de alto valor que combina modelos de visión con búsquedas en bases de datos locales. Los gerentes de las tiendas deben asegurarse de que los estantes coincidan con los planogramas corporativos “ideales” (por ejemplo, el orden correcto de los productos, la cantidad de frentes objetivo y la disponibilidad de stock). Las revisiones manuales son lentas y enviar imágenes de alta resolución de los estantes a los modelos de visión en la nube genera una enorme sobrecarga de red y costos de procesamiento en la nube, además de fallar cuando la red Wi-Fi de la tienda se cae. Con la IA en el borde, una aplicación móvil captura la imagen de un estante, ejecuta el modelo de visión localmente para identificar productos y frentes, y consulta un índice vectorial local para comparar los artículos detectados con el planograma. Las deficiencias de cumplimiento surgen al instante, incluso sin conexión, sin que un solo byte de datos de imagen abandone la tienda.

Móvil

Ejemplos de aplicaciones móviles que ejecutan inferencia en el dispositivo incluyen asistentes de voz que procesan el habla localmente, aplicaciones de traducción en vivo que funcionan sin conexión de datos y funciones de cámara como mejora de fotos en tiempo real y reconocimiento de objetos. Estos casos de uso requieren baja latencia y, en muchos casos, capacidad sin conexión.

IoT y hogar inteligente

Los parlantes inteligentes que procesan comandos de voz, los termosatos que toman decisiones autónomas de confort y las cerraduras inteligentes que ejecutan verificación biométrica de forma local, todos utilizan la IA en el borde para evitar viajes de ida y vuelta a la nube que introducen una latencia inaceptable o generan exposición de la privacidad.

Industrial y de manufactura

Los sistemas perimetrales industriales y de manufactura incluyen mantenimiento predictivo que analiza los datos de los sensores de los equipos, inspección visual de defectos en las líneas de producción y alertas en tiempo real para condiciones de seguridad. Todo esto se ejecuta en el perímetro debido a que la latencia de ida y vuelta a la nube es demasiado alta y las consecuencias de una detección fallida son demasiado significativas.

Salud

Las implementaciones comunes de Edge AI en la salud incluyen dispositivos vestibles que monitorean datos biométricos, soporte de diagnóstico en el dispositivo para equipos de ambulancias y atención de campo, y sistemas de monitoreo de pacientes en hospitales que procesan datos localmente para mantener el cumplimiento de las regulaciones de privacidad de datos. La velocidad y la gobernanza de datos son fundamentales para los tres ejemplos.

Automotriz

Los sistemas avanzados de asistencia al conductor (ADAS), la detección de carriles en tiempo real, la evasión de obstáculos y el monitoreo del conductor requieren inferencia en el borde. Un vehículo no puede esperar una respuesta en la nube al tomar una decisión de seguridad.

Lo que la IA en el borde necesita de su capa de datos

Los fabricantes de hardware describen la IA de borde en términos de chips y compresión de modelos. Los proveedores de la nube la describen en términos de canales de implementación. Ninguno explica qué sucede cuando el modelo necesita datos para hacer su trabajo. Un modelo que ejecuta inferencia local necesita contexto local, como preferencias de usuario, registros históricos, catálogos de productos, líneas base de sensores y estado de sesión. La capa de datos determinadónde residen esos datos y cómo llegan allí.

La inferencia local necesita datos locales

Una aplicación de inteligencia artificial perimetral que fundamenta sus respuestas en el contexto local necesita un lugar donde almacenar dicho contexto. La generación aumentada por recuperación (RAG) local requiere un almacenamiento en el dispositivo que pueda procesar consultas de similitud con baja latencia y albergar incrustaciones y documentos de origen, todo ello sin conectividad. Cuando un agente de inteligencia artificial perimetral necesita recuperar el contexto relevante antes de generar una respuesta, la base de datos integrada o perimetral que consulta determina si la recuperación es posible.

Lecturas y escrituras de baja latencia

Las ganancias de latencia al ejecutar inferencia local desaparecen si la capa de datos es lenta. Una base de datos empotrada que sirve lecturas desde almacenamiento local con una latencia inferior a un milisegundo completa la promesa de la IA en el borde. Una capa de datos que realiza llamadas de red, utiliza almacenamiento pesado en disco o tiene una alta sobrecarga de consultas borra la ventaja que se suponía que debía proporcionar la inferencia local.

Operación continua

Una base de datos de IA en el borde debe operar completamente sin conexión y conciliar los datos correctamente cuando se restablece la conectividad. Esto es diferente de la degradación elegante. La aplicación no debe perder funcionalidad, encolar fallas ni producir resultados inconsistentes cuando la red se cae. El comportamiento correcto es la operación completa sin conexión seguida de una sincronización confiable cuando la aplicación se reconecta.

Sincronización de la nube al borde

Los modelos, las incrustaciones y los datos operativos deben fluir desde la nube hacia los servidores periféricos y los dispositivos, y los datos actualizados deben fluir de regreso. Esto capa de sincronización necesita manejar actualizaciones bidireccionales, resolver conflictos cuando el mismo registro se actualiza en múltiples lugares y operar de manera eficiente con conexiones intermitentes.

Seguridad y gobernanza en el borde

El cifrado en reposo, el acceso local autenticado y la capacidad de redactar o filtrar datos sensibles antes de que lleguen a una llamada a un LLM son requisitos en el edge tanto como lo son en la nube. Los datos almacenados en los dispositivos siguen estando sujetos a normativas de privacidad, requisitos de auditoría y controles de acceso, y la capa de datos debe aplicarlos localmente.

Cómo Couchbase impulsa la IA en el borde

Couchbase proporciona una capa de datos conectada entre la nube, el servidor perimetral y el dispositivo que cumple con los cinco requisitos anteriores. Utiliza el mismo lenguaje de consulta SQL++ y las mismas API en todos los niveles.

RequisitoCapacidad de CouchbaseComponentes
La inferencia local necesita datos localesAlmacenamiento NoSQL en el dispositivo con indexación vectorial para RAGCouchbase Lite
Lecturas y escrituras de baja latenciaLatencia de consulta inferior a un milisegundo desde almacenamiento incrustadoCouchbase Lite
Operación continuaFuncionalidad sin conexión y sin dependencia de la nubeCouchbase Lite
Sincronización de la nube al bordeReplicación bidireccional, resolución de conflictos, sincronización de igual a igualCouchbase Mobile, Couchbase Lite
Seguridad y gobernanza en el bordeCifrado en reposo, control de acceso detallado, aplicación en el bordeCouchbase Lite, Edge Server, App Services

Base de datos integrada en el dispositivo con búsqueda vectorial local: Couchbase Lite es una base de datos NoSQL integrada para aplicaciones móviles e IoT. Almacena documentos JSON e incrustaciones vectoriales localmente, ejecuta consultas SQL++ y búsquedas de similitud sin conexión de red, y admite consultas predictivas para llamar directamente a modelos de IA locales. Es la capa de datos para RAG en el dispositivo y la fundamentación de inferencia local.

Couchbase Lite también ofrece a los desarrolladores dos capacidades que importan a escala periférica: Funciones de Predicción, que generan incrustaciones sobre la marcha durante una consulta para que la aplicación no necesite una canalización de incrustaciones independiente, y Indexación Vectorial Perezosa, que permite a los desarrolladores programar actualizaciones pesadas de índices vectoriales en segundo plano sin bloquear la interfaz de usuario o el rendimiento de la aplicación. Ambas son importantes en entornos periféricos limitados donde los recursos de computación y batería son reducidos.

Sincronización de la nube al extremo (edge) y de igual a igual (peer-to-peer): Couchbase Móvil maneja la sincronización bidireccional entre Couchbase Lite en los dispositivos y la capa en la nube con resolución de conflictos integrada, control de acceso de grano fino y compatibilidad con la sincronización de igual a igual (P2P) entre dispositivos en la misma red. Los datos fluyen correctamente ya sea que los dispositivos estén en línea, fuera de línea o conectados únicamente entre sí.

Nivel de centro de datos perimetral para sitios con recursos limitados: Couchbase Edge Server proporciona una implementación de base de datos ligera para pisos de fábricas, oficinas traseras minoristas y otros sitios periféricos que necesitan un nivel de datos local pero no pueden ejecutar una infraestructura completa de centro de datos. Conecta las bases de datos en el dispositivo y la nube, agregando datos de múltiples dispositivos y manteniendo un almacenamiento local para el sitio.

Infraestructura troncal en la nube Couchbase Capella es la capa de DBaaS administrada que sirve como la fuente de datos autoritativa para el despliegue perimetral. Maneja la distribución de modelos, los canales de datos de entrenamiento, las análisis agregados y la aplicación de políticas de gobernanza. Capella se ejecuta en AWS, Azure y Google Cloud.

Recuperación semántica en el borde: Búsqueda vectorial de Couchbase runs natively in both Couchbase Lite and Capella, enabling hybrid search (vector similarity plus keyword plus structured filters in one query) at every tier of the architecture. Edge AI applications that need semantic retrieval don’t require a separate vector store.

This consistency eliminates the hidden cost of maintaining platform-specific sync logic, reduces operational surface area, and lets teams build once instead of rebuilding per platform. It’s the core operational advantage of a unified data architecture from cloud to edge.

Edge AI FAQs

What is edge AI in simple terms? 

Edge AI runs AI inference on local devices or infrastructure close to where data is created, rather than sending data to a distant cloud data center for processing. The model and the data it needs both live at or near the point of use, which means lower latency, offline capability, and better data privacy compared to cloud AI.

How is edge AI different from cloud AI?

Edge AI runs inference locally on a device, gateway, or edge server, reducing latency, supporting offline operation, and keeping sensitive data closer to its source. Cloud AI processes data in remote data centers, providing greater compute power for training large models and running GPU-intensive workloads. Most production deployments use both, with edge handling real-time inference and offline operation, and cloud handling training, analytics, and governance.

Does edge AI work offline?

Yes, as long as the model, runtime, and required data are all available locally. For applications that read and write data offline, this requires a local database that operates fully without connectivity and syncs correctly when the connection is restored. Applications that rely on cloud data access will fail offline even if the model itself is deployed locally.

What database does an edge AI application use?

Edge AI applications need a database that operates fully offline, serves sub-millisecond queries from local storage, performs vector search for RAG without a network connection, and syncs bidirectionally with the cloud while automatically resolving conflicts. Couchbase Lite is purpose-built for these requirements. It’s an embedded NoSQL database for mobile and IoT deployments that provides local storage, vector search, SQL++ queries, and cloud sync in a single library. It eliminates the need for multiple databases and platform-specific custom sync logic.

Is edge AI the same as on-device AI?

No. On-device AI is a subset of edge AI where the model runs entirely on the end device with no dependency on a nearby server. Edge AI is the broader category, covering on-device deployments as well as nearby edge servers and gateways that serve multiple devices. All on-device AI is edge AI, but not all edge AI is on-device.

What are the main challenges of edge AI?

The three most significant challenges are:

  • Model size – Compressed models trade some precision for the ability to run on constrained hardware.
  • Data synchronization – Keeping data consistent across devices, edge servers, and the cloud requires a sync layer with conflict resolution.
  • Governance – Access control, encryption, and compliance requirements apply at the edge just as they do in the cloud, and the infrastructure has to enforce them locally.

Compartir este artículo

Autor

Deja un comentario

¿Listo para comenzar con Couchbase Capella?

Comenzar a construir

Visita nuestro portal para desarrolladores para explorar NoSQL, consultar recursos y comenzar con los tutoriales.

Usa Capella gratis

Empieza a usar Couchbase en tan solo unos clics. Capella DBaaS es la forma más fácil y rápida de comenzar.

Ponte en contacto

¿Quieres saber más sobre las ofertas de Couchbase? Permítenos ayudarte.