Glosario

Qué es un modelo multimodal

Un modelo multimodal entiende texto, imágenes, audio y video a la vez. Qué es, para qué te sirve en tu negocio y el error de seguir tratándolo como si solo leyera texto.

3 min de lectura · Datos comprobados el 20/9/2026

Qué es

Un modelo multimodal es el que maneja más de un tipo de información a la vez. No solo lee lo que escribes: según el modelo, también puede mirar una foto, escuchar un audio o leer el texto dentro de una imagen.

«Multimodal» viene de «muchos modos»: muchos formatos de entrada en un mismo modelo. Le puedes pasar una foto de un recibo y pedirle que extraiga los datos, o un audio y pedirle un resumen.

Explicado fácil

Un modelo de lenguaje se mueve, sobre todo, en texto. Un modelo multimodal es como una persona: según lo que admita, además de leer mira o escucha. Le pones una foto encima de la mesa y la entiende; le pasas un audio y lo sigue.

Por eso las aplicaciones de hoy te dejan pegar una captura y preguntar «¿qué dice este contrato?», y responden: porque el modelo que tienen detrás sabe mirar.

Ejemplo práctico

Un despacho recibe facturas de proveedores, muchas escaneadas o en foto. En lugar de teclearlas una a una, la persona le pasa al modelo la foto de cada factura y le pide que extraiga proveedor, importe y fecha, y los deje en una tabla.

El modelo mira la imagen, lee lo que hay escrito y devuelve los datos ordenados. La persona solo revisa los que le parecen raros. Lo que antes era transcribir se vuelve verificar.

Por qué te importa

Porque abre tareas que antes no podías darle a la IA: todo lo que llega en foto, escaneo, audio o video. Facturas fotografiadas, notas de voz de clientes, capturas de pantalla, un video de instrucciones.

Si tu negocio trabaja con papel o con fotos, un modelo multimodal es la pieza que convierte ese desorden en texto ordenado.

El error típico

Seguir tratando a la IA como si solo leyera texto, y teclear a mano lo que ya está en una imagen. O al revés: dar por hecho que tu herramienta admite imágenes sin comprobarlo, y extrañarse del resultado. Primero comprueba en la documentación qué modalidades admite tu herramienta, y después decide qué le pasas.

No lo confundas con

Un modelo de lenguaje. Un modelo de lenguaje puede ser solo de texto o también multimodal; no son categorías excluyentes. Multimodal significa que maneja más de una modalidad.

Una aplicación que acepta archivos. Que puedas adjuntar una foto no garantiza que la «vea»: puede que la aplicación la pase a texto con otro programa antes. Lo que define al multimodal es que el modelo mira directo.

Relacionados

Modelo de IA · Modelo de lenguaje · IA generativa · Asistente de IA · Encargo (prompt)

Sigue por aquí