IA multimodal: cómo comprender simultáneamente texto, imágenes y audio
Al finalizar este tema
- Podrás explicar el concepto preciso de multimodalidad y sus diferencias con los sistemas unimodales tradicionales.
- Comprenderás cómo la IA procesa conjuntamente datos en diversas formas, como texto, imágenes, audio y video.
- Podrás distinguir claramente entre los principales casos de uso de la tecnología multimodal y los malentendidos frecuentes.
Se ha ingresado una fotografía
Subí una foto de una deliciosa pasta a ChatGPT o Claude y pregunté: "¿Cuál es el nombre de este plato y cómo se prepara?".
La IA identificó inmediatamente los ingredientes visibles en la foto (tomate, albahaca, fideos, etc.) y proporcionó una receta detallada. La IA que antes solo comprendía texto, ahora puede 'ver' imágenes, 'escuchar' audio y 'analizar' video. Esta tecnología de inteligencia artificial que maneja simultáneamente múltiples formas de percepción (modalidades) se denomina multimodalidad.
Unimodal vs. Multimodal
El término 'modalidad' se refiere a la forma de los datos (texto, imagen, audio, video, etc.).
1. Unimodal
- Funcionamiento: Maneja únicamente un tipo de dato.
- Limitaciones: Los LLM iniciales, por ejemplo, solo comprendían texto; o bien, las funciones estaban fragmentadas en sistemas dedicados exclusivamente al reconocimiento de voz o a la generación de imágenes. Era necesario describir extensamente la situación mediante texto para que el sistema pudiera comprenderla.
2. Multimodal
- Funcionamiento: Combina múltiples tipos de datos para realizar entradas y salidas simultáneas.
- Innovación: Incluso si se transmite texto junto con imágenes o audio al mismo tiempo, la IA los comprende de manera integrada, generando resultados naturales.
Analogía en una línea:
Si el sistema unimodal es como 'una persona que se comunicaba con el mundo únicamente mediante llamadas telefónicas', el sistema multimodal es como 'una persona que utiliza la vista, el oído y la voz para ver material visual y conversar directamente'.
¿Cómo funciona la multimodalidad?
¿Cómo puede la IA comprender simultáneamente texto e imágenes?
- Representación numérica conjunta:
- No se trata el texto ("perro") y la foto de un perro como lenguajes distintos, sino que se mapean a la misma posición conceptual en un espacio matemático (espacio vectorial).
- Comprensión de contexto cruzado:
- Conecta posiciones específicas dentro de la imagen con palabras específicas del texto de la pregunta, respondiendo con precisión a interrogantes como "¿qué es esta parte de la foto?".
- Generación de diversas salidas:
- Además de proporcionar respuestas en texto, puede generar nuevas imágenes apropiadas o hablar directamente con una voz natural.
¿Dónde se utiliza?
La multimodalidad se está expandiendo a numerosas áreas que encontramos en nuestra vida cotidiana.
- Asistencia visual y conducción autónoma: Interpretación en tiempo real del entorno vial, obstáculos y señales mediante el reconocimiento de cámaras.
- Análisis de imágenes médicas: Análisis de radiografías o resonancias magnéticas e informe al médico con un borrador textual de los hallazgos diagnósticos.
- Diseño y creación de contenido: Visualización basada en indicaciones como "genera una ilustración para la portada que se ajuste a este ambiente".
- Diálogo de voz en tiempo real: Interacción conversacional mediante vídeo y audio en tiempo real, manteniendo contacto visual con el usuario.
Malentendidos frecuentes y puntos de atención
❌ "¿Al volverse multimodal, el 'cerebro' (inteligencia) de la IA se vuelve mucho más inteligente?"
No. El enfoque multimodal no aumenta la 'inteligencia' del cerebro de la IA, sino que amplía los tipos de sentidos de entrada y salida (vista, oído, etc.). Al igual que el hecho de que una persona tenga ojos y oídos no implica un aumento repentino de su CI, simplemente se diversifican los tipos de datos recibidos; la inteligencia de razonamiento en sí misma no aumenta exponencialmente.
Distinguir primero entre las combinaciones de entrada y salida
No es posible juzgar las capacidades de un producto únicamente por el término "multimodal". Es necesario verificar qué recibe como entrada y qué produce como salida por separado.
| Tipo | Entrada | Salida | Ejemplo |
|---|---|---|---|
| Comprensión | Imagen + Texto | Texto | Preguntas y respuestas sobre imágenes, OCR |
| Generación | Texto | Imagen/Audio | Generación de imágenes, TTS |
| Integrado | Vídeo + Audio + Texto | Texto/Audio | Asistencia en reuniones en tiempo real |
El hecho de que un modelo pueda ver imágenes no significa que pueda generarlas. Del mismo modo, un modelo de difusión que genera dibujos con habilidad no necesariamente lee con precisión las tablas presentes en una fotografía.
¿Cómo se combinan internamente?
Cada modalidad pasa primero por un codificador dedicado. Las imágenes se dividen en parches, el audio en segmentos temporales y el texto en tokens. Posteriormente, una capa de proyección adapta estas representaciones al espacio que puede manejar el modelo lingüístico, y la atención cruzada o el Transformer integrado calculan las relaciones entre ellos.
patch de imagen ─ codificador de imágenes ─┐
frame de audio ─ codificador de audio ─┼→ alineación y fusión de representaciones → respuesta
token de texto ─ codificador de texto ─┘El «espacio vectorial común» es una explicación representativa, pero no todos los modelos multimodales utilizan la misma estructura. Debe verificar en la tarjeta del modelo las entradas admitidas, la resolución, la duración del audio, el muestreo de fotogramas y las modalidades de salida.
Criterios para evaluar la calidad
- En la OCR, además de la precisión de los caracteres, se debe verificar la preservación de la estructura de filas y columnas de las tablas.
- En las preguntas y respuestas sobre imágenes, se debe comprobar si el modelo inventa detalles que no son visibles.
- En el video, se evalúa la secuencia de eventos entre fotogramas y la memoria a largo plazo.
- En el audio, se prueban por separado la entonación, el ruido, la superposición de hablantes y la terminología especializada.
- Para imágenes médicas e industriales, es necesaria una validación específica del dominio, no solo las pruebas comparativas generales de fotografía.
Privacidad y seguridad
Las fotografías pueden contener rostros, ubicación, documentos y pantallas; el audio puede incluir identidades y conversaciones del entorno. Antes de cargar, recorte las áreas innecesarias, verifique la política de retención y si los datos se utilizan para el entrenamiento, y asegúrese de que las decisiones críticas, como los diagnósticos o la verificación de la identidad, pasen por la revisión de un experto.
Resumen clave
- Este término debe entenderse en conexión con los datos, el software y los procedimientos operativos, no como una característica de un solo modelo de IA.
- Verifique específicamente las entradas, salidas, permisos y criterios de evaluación, más allá de las descripciones del producto.
- Confirme nuevamente los resultados y acciones importantes con sus fundamentos, verificadores y la aprobación humana.
Conceptos siguientes
→ Profundizar: AI Native — Transformers y embeddings