Qué es
La multimodalidad es la capacidad de un sistema de inteligencia artificial de
recibir en la misma petición más de un tipo de entrada —texto e imágenes, a
veces audio— y relacionarlas entre sí. Uno de texto necesita que todo le llegue
escrito; uno multimodal acepta la foto junto con la instrucción.
Lo que cambia no es que admita un archivo de imagen, sino que esa imagen entra
al mismo proceso que el prompt: dónde está el
sello o qué renglón va con qué columna forma parte de lo que considera al
responder. La palabra nombra lo que la herramienta alcanza a recibir, no la
forma en que contesta: lo leído en una imagen puede devolverse en campos y no en
prosa, que ya es asunto del
En palabras de contador
Es el que además de leer el documento puede ver la foto. No es que transcriba la
imagen para después leer la transcripción: la mira. Como quien recibe por
mensaje la foto de un estado de cuenta y entiende de qué se trata sin pedir que
se la pasen a máquina.
Ahí está la frontera con el OCR. El OCR convierte
la imagen en texto y alguien lee ese texto; el acomodo del papel ya se perdió.
La diferencia se nota cuando importa la disposición y no solo las palabras: un
sello encimado sobre una cifra, una corrección a mano al margen.
Ejemplo aplicado
La foto del estado de cuenta que manda el cliente. Llega chueca y con
reflejo, y aun así acomoda los movimientos con su fecha y su importe respetando el
orden de las columnas. Lo que quede dudoso lo confirmas contra el estado de
cuenta.
La captura de pantalla de un portal. En vez de describir lo que ves, le pasas
la captura y preguntas qué campo quedó vacío.
El convenio escaneado con anotaciones al margen. Trae correcciones a mano
junto a la cláusula que modifican; que estén ahí y no en otro párrafo es el dato
a conservar.
Para qué sirve en un despacho
- Aprovechar lo que el cliente manda por mensajería sin recapturarlo.
- Leer documentos donde el acomodo importa: tablas, sellos, firmas al calce.
- Revisar capturas de pantalla sin describirlas por escrito.
- Ordenar papeles que nunca existieron como archivo de datos.
Riesgos o limitaciones
Ver la imagen no vuelve cierto lo que se lee en ella. Una foto movida o con
sombra deja huecos, y el modelo puede completarlos con lo que parece razonable:
el terreno de la
alucinación. Un dígito mal leído se
integra al resultado como dato firme.
Y dos cosas no cambian: la foto de un comprobante no es el comprobante, y mandar
la imagen de un documento del cliente manda información suya a un tercero, con
lo que implica en privacidad.
Buena práctica
Compruébalo antes de confiarle un pendiente real. Toma tres documentos
difíciles —un escaneo pálido, una tabla con celdas combinadas, un sello
encimado— y contrasta el resultado con lo que ya sabes que dicen. Manda la
misma imagen dos veces: si el importe cambia, ya sabes cuánto pesa.
Pide además que avise qué no alcanza a leer en lugar de completarlo. Que marque
"esta cifra está cortada" vale más que el renglón lleno.
Preguntas frecuentes
¿En qué se distingue del OCR? El OCR entrega el texto de la imagen para que
alguien lo lea; un sistema multimodal trabaja sobre la imagen misma.
¿Le mando la foto o el archivo original? Si el archivo de datos existe,
úsalo: trae los campos separados y no depende de la iluminación. La foto es para
lo que nunca tuvo esa forma.
¿Sirve para revisar comprobantes fiscales? Como apoyo para leer una imagen,
sí; la revisión formal corre sobre el XML, no
sobre la fotografía.
Términos relacionados
Conexión NexFiscal
Aquí sirve más un criterio que una herramienta: la pregunta no es si el sistema alcanza a ver la imagen, sino si hacía falta que la viera. Cuando del documento ya existe una versión estructurada —el [XML](/recursos/diccionario/xml/), que todo despacho tiene a la mano—, mirar la fotografía agrega un paso de lectura donde el archivo ya trae el dato con su nombre. La multimodalidad se gana su lugar en el tramo contrario, que no es pequeño: el estado de cuenta que llegó por mensajería, el convenio escaneado, el papel que nadie emitió como archivo. Ahí toca elegir con qué leerlo, y el [OCR](/recursos/diccionario/ocr/) es la otra opción sobre la mesa. El orden que conviene sostener es ese: el archivo cuando existe, la imagen cuando no.
Escrito y revisado por Ernesto Sobrino, contador.
Última revisión: 24 de agosto de 2026.