Saltar al contenido
NexFiscal
Productos Recursos Contacto Hablar con el equipo
Productos Recursos Contacto Hablar con el equipo
NexFiscal›Recursos›Diccionario de IA›Multimodalidad
Diccionario de IA para Contadores

Multimodalidad: qué cambia cuando la IA ve la imagen y no solo el texto

Hay herramientas que solo procesan lo que les llega escrito y otras que además miran la imagen: la foto del estado de cuenta, la captura de pantalla, el convenio escaneado. Eso es la multimodalidad, y la diferencia con el OCR se nota justo cuando importa cómo está acomodado el papel.

Básico Qué entiende y qué devuelve

Qué es

La multimodalidad es la capacidad de un sistema de inteligencia artificial de

recibir en la misma petición más de un tipo de entrada —texto e imágenes, a

veces audio— y relacionarlas entre sí. Uno de texto necesita que todo le llegue

escrito; uno multimodal acepta la foto junto con la instrucción.

Lo que cambia no es que admita un archivo de imagen, sino que esa imagen entra

al mismo proceso que el prompt: dónde está el

sello o qué renglón va con qué columna forma parte de lo que considera al

responder. La palabra nombra lo que la herramienta alcanza a recibir, no la

forma en que contesta: lo leído en una imagen puede devolverse en campos y no en

prosa, que ya es asunto del

structured output.

En palabras de contador

Es el que además de leer el documento puede ver la foto. No es que transcriba la

imagen para después leer la transcripción: la mira. Como quien recibe por

mensaje la foto de un estado de cuenta y entiende de qué se trata sin pedir que

se la pasen a máquina.

Ahí está la frontera con el OCR. El OCR convierte

la imagen en texto y alguien lee ese texto; el acomodo del papel ya se perdió.

La diferencia se nota cuando importa la disposición y no solo las palabras: un

sello encimado sobre una cifra, una corrección a mano al margen.

Ejemplo aplicado

La foto del estado de cuenta que manda el cliente. Llega chueca y con

reflejo, y aun así acomoda los movimientos con su fecha y su importe respetando el

orden de las columnas. Lo que quede dudoso lo confirmas contra el estado de

cuenta.

La captura de pantalla de un portal. En vez de describir lo que ves, le pasas

la captura y preguntas qué campo quedó vacío.

El convenio escaneado con anotaciones al margen. Trae correcciones a mano

junto a la cláusula que modifican; que estén ahí y no en otro párrafo es el dato

a conservar.

Para qué sirve en un despacho

  • Aprovechar lo que el cliente manda por mensajería sin recapturarlo.
  • Leer documentos donde el acomodo importa: tablas, sellos, firmas al calce.
  • Revisar capturas de pantalla sin describirlas por escrito.
  • Ordenar papeles que nunca existieron como archivo de datos.

Riesgos o limitaciones

Ver la imagen no vuelve cierto lo que se lee en ella. Una foto movida o con

sombra deja huecos, y el modelo puede completarlos con lo que parece razonable:

el terreno de la

alucinación. Un dígito mal leído se

integra al resultado como dato firme.

Y dos cosas no cambian: la foto de un comprobante no es el comprobante, y mandar

la imagen de un documento del cliente manda información suya a un tercero, con

lo que implica en privacidad.

Buena práctica

Compruébalo antes de confiarle un pendiente real. Toma tres documentos

difíciles —un escaneo pálido, una tabla con celdas combinadas, un sello

encimado— y contrasta el resultado con lo que ya sabes que dicen. Manda la

misma imagen dos veces: si el importe cambia, ya sabes cuánto pesa.

Pide además que avise qué no alcanza a leer en lugar de completarlo. Que marque

"esta cifra está cortada" vale más que el renglón lleno.

Preguntas frecuentes

¿En qué se distingue del OCR? El OCR entrega el texto de la imagen para que

alguien lo lea; un sistema multimodal trabaja sobre la imagen misma.

¿Le mando la foto o el archivo original? Si el archivo de datos existe,

úsalo: trae los campos separados y no depende de la iluminación. La foto es para

lo que nunca tuvo esa forma.

¿Sirve para revisar comprobantes fiscales? Como apoyo para leer una imagen,

sí; la revisión formal corre sobre el XML, no

sobre la fotografía.

Términos relacionados

  • OCR
  • XML
  • Structured output
  • Alucinación

Conexión NexFiscal

Aquí sirve más un criterio que una herramienta: la pregunta no es si el sistema alcanza a ver la imagen, sino si hacía falta que la viera. Cuando del documento ya existe una versión estructurada —el [XML](/recursos/diccionario/xml/), que todo despacho tiene a la mano—, mirar la fotografía agrega un paso de lectura donde el archivo ya trae el dato con su nombre. La multimodalidad se gana su lugar en el tramo contrario, que no es pequeño: el estado de cuenta que llegó por mensajería, el convenio escaneado, el papel que nadie emitió como archivo. Ahí toca elegir con qué leerlo, y el [OCR](/recursos/diccionario/ocr/) es la otra opción sobre la mesa. El orden que conviene sostener es ese: el archivo cuando existe, la imagen cuando no.

Revisa qué trae el XML de un comprobante que ninguna foto puede darte, y por qué la revisión seria corre sobre él

Escrito y revisado por Ernesto Sobrino, contador.
Última revisión: 24 de agosto de 2026.

NexFiscal

Asesorar, no descargar.

Soluciones fiscales para despachos contables mexicanos.

Ecosistema

  • NexFiscal SaaS
  • NexFiscal Skill
  • NexFiscal Corporativo
  • NexBot · marca hermana

Empresa

  • Contacto
  • Aviso de Privacidad
  • Términos y Condiciones

Contacto

  • [email protected]
  • WhatsApp · +52 999 641 4441
  • Tulum, Quintana Roo, México
© 2026 Roller Monkey, S. de R.L. de C.V. · RFC RMO150921LJ2
Todos los derechos reservados.