

Hemos hablado de la IA como si fuera una sola cosa, como si fuera solo un modelo que recibe texto, predice el siguiente token, y así construye una respuesta. Y eso es una simplificación útil al inicio, pero se queda corta en cuanto abres cualquier herramienta de IA generativa moderna y ves que puede generar una imagen, escribir una función en Python, o analizar una foto. Por eso vale la pena separar estas capacidades y entender qué las diferencia, porque cada tipo de IA generativa espera un tipo de prompt distinto. Un prompt que funciona con un modelo de texto puede ser completamente inútil o contraproducente con un modelo de imagen. |
We have talked about AI as if it were a single thing, as if it were simply a model that receives text, predicts the next token, and builds a response from there. That is a useful simplification at first, but it quickly falls short when you open a modern generative AI tool and see that it can generate an image, write a function in Python, or analyze a photograph. That is why it is worth separating these capabilities and understanding what makes them different, because each type of generative AI expects a different kind of prompt. A prompt that works with a text model can be completely useless—or even counterproductive—with an image model. |
Lo que ya conocemosLos modelos de lenguaje (LLMs) que vimos en los artículos anteriores son el ejemplo más maduro de IA generativa de texto: reciben una secuencia de tokens y predicen, uno a uno, cuál debería venir después. Con eso construyen resúmenes, traducciones, código, etc. Lo que distingue el uso de un modelo de texto es que casi todo el trabajo de diseño del prompt ocurre en el lenguaje mismo: claridad de las instrucciones, orden de la información, ejemplos que incluyes, etc. Si le pides a Claude o a ChatGPT que redacte un correo de reclamación a una aerolínea, el resultado depende casi por completo de cuánta información específica le des —vuelo, fecha, motivo— y no de parámetros externos. Eso será más relevante en el próximo artículo, cuando hablemos de buenas y malas prácticas al escribir tus primeros prompts. |
What We Already KnowThe language models (LLMs) we covered in previous articles are the most mature example of text-based generative AI: they receive a sequence of tokens and predict, one by one, which token should come next. With that mechanism, they can produce summaries, translations, code, and more. What distinguishes the use of a text model is that almost all prompt design work happens within the language itself: how clear the instructions are, how the information is organized, which examples you include, and so on. If you ask Claude or ChatGPT to write a complaint email to an airline, the result depends almost entirely on how much specific information you provide—flight, date, reason—and not on external parameters. This will become more relevant in the next article, when we discuss good and bad practices for writing your first prompts. |

De ruido a formaLos modelos de generación de imagen —como Midjourney, DALL-E, Stable Diffusion, o herramientas como Nano Banana— funcionan bajo un principio distinto al de los LLMs, aunque el prompt sigue siendo texto. Muchos sistemas modernos de generación de imágenes utilizan procesos de difusión o arquitecturas relacionadas. Durante el entrenamiento, las imágenes se someten a un proceso en el que se les añade ruido gradualmente hasta que su estructura queda prácticamente irreconocible. El modelo aprende entonces a estimar y eliminar ese ruido paso a paso, condicionado por la información disponible, como una descripción de texto. Cuando generas una imagen nueva, el proceso comienza con ruido aleatorio y el modelo lo va transformando progresivamente, guiado por tu prompt, hasta producir una imagen coherente con lo que pediste. Esto tiene consecuencias para cómo prompteas. Por ejemplo, el número de pasos de generación afecta la calidad del resultado, ya que en algunos flujos de trabajo, entre 20 y 30 pasos alcanza para un borrador, mientras que entre 50 y 80 se acerca a calidad de producción, y ese es un parámetro que en los modelos de texto simplemente no existe. También existe un control llamado escala de guía (CFG) en muchas interfaces basadas en modelos de difusión, que regula cuánto se apega el modelo a tu descripción frente a cuánta libertad creativa toma por su cuenta, y valores bajos dan más libertad creativa, valores medios equilibran creatividad y fidelidad al prompt, y valores altos siguen el prompt de forma estricta aunque a veces a costa de la calidad. |
From Noise to FormImage-generation models—such as Midjourney, DALL-E, Stable Diffusion, or tools like Nano Banana—operate on a different principle from LLMs, even though the prompt is still written in text. Many modern image-generation systems use diffusion processes or related architectures. During training, images undergo a process in which noise is gradually added until their original structure becomes almost unrecognizable. The model then learns to estimate and remove that noise step by step, conditioned by the available information, such as a text description. When you generate a new image, the process begins with random noise, which the model progressively transforms, guided by your prompt, until it produces an image consistent with what you requested. This has consequences for the way you write prompts. For example, the number of generation steps can affect the quality of the result. In some workflows, 20 to 30 steps may be enough for a draft, while 50 to 80 can get closer to production quality—and that is a parameter that simply does not exist in text models. Many interfaces based on diffusion models also include a control called guidance scale (CFG), which regulates how closely the model follows your description versus how much creative freedom it takes on its own. Lower values allow more creative freedom, medium values balance creativity and fidelity to the prompt, and higher values follow the prompt more strictly, sometimes at the expense of image quality. |

Por ejemplo, si escribes "un tomate con manchas negras en la hoja", quizá obtengas una imagen genérica de un tomate con manchas —probablemente decorativas y no fitopatológicas reales—, porque el modelo no está razonando sobre agronomía, sino prediciendo qué píxeles suelen acompañar esas palabras en su entrenamiento. Si en cambio describes "una hoja de tomate con lesiones necróticas circulares de bordes concéntricos, típico de tizón temprano, fotografía macro con iluminación natural", el resultado se acerca mucho más a algo útil, porque le diste al modelo referencias visuales más específicas. |
For example, if you write "a tomato with black spots on the leaf," you may get a generic image of a tomato with spots—probably decorative rather than genuine phytopathological symptoms—because the model is not reasoning about agronomy. It is predicting which pixels tend to accompany those words in its training data. If instead you describe "a tomato leaf with circular necrotic lesions and concentric borders, typical of early blight, macro photograph with natural lighting," the result is much more likely to be useful because you have given the model more specific visual references. |

Texto con reglas más estrictasLa generación de código —GitHub Copilot, Cursor, o el propio Claude cuando le pides una función— es un caso particular de generación de texto. El modelo fue entrenado también con repositorios de código, documentación técnica y foros como Stack Overflow, así que predice el siguiente token de la misma manera que predeciría la siguiente palabra en una oración. Pero la diferencia es que el código tiene una sintaxis rígida, pues un paréntesis de más rompe todo el programa, mientras que una coma de más en un párrafo apenas se nota. Esto hace que los prompts para código premien la precisión sobre la elegancia. Si pides "escríbeme una función que ordene una lista", puede darte resultados ambiguos: ¿en qué lenguaje, qué tipo de datos, ordenar de mayor a menor o al revés, qué pasa con los valores repetidos? Pero si pides "en Python, escribe una función |
Text with Stricter RulesCode generation—GitHub Copilot, Cursor, or Claude itself when you ask it to write a function—is a particular case of text generation. The model has also been trained on code repositories, technical documentation, and forums such as Stack Overflow, so it predicts the next token in much the same way it would predict the next word in a sentence. The difference is that code has rigid syntax: one extra parenthesis can break an entire program, whereas one extra comma in a paragraph may barely be noticeable. This means that prompts for code reward precision over elegance. If you ask, "write me a function that sorts a list," you may get ambiguous results: in which language, what type of data, ascending or descending order, what happens with duplicate values? But if you ask, "in Python, write a function |


Cuando deja de estar encerrado en un solo tipo de datoLa IA multimodal no es un cuarto tipo aislado, sino la capacidad de combinar los anteriores dentro de un mismo modelo: recibir texto, imagen, audio o video como entrada, y, según sus capacidades, producir salidas en una o varias modalidades de esos formatos como salida. A diferencia de los modelos tradicionales diseñados para un solo tipo de dato, un modelo multimodal puede, por ejemplo, recibir la foto de un paisaje y generar un resumen escrito de sus características, o recibir una descripción escrita y generar una imagen a partir de ella. Esto es lo que uso yo mismo bastante seguido: le subo a un modelo la foto de una planta con síntomas raros en las hojas y le pido que me ayude a acotar posibles causas —plaga, deficiencia nutricional, exceso de riego— antes de ir a revisar bibliografía específica. El modelo no ve la imagen como la vería un agrónomo con experiencia, pero sí puede describir patrones visuales (como clorosis internerval, manchas necróticas, deformación foliar) y cruzarlos con lo que sabe en texto. No sustituye un diagnóstico real, pero acelera la primera pasada de descarte, sobre todo cuando no tengo el libro de fitopatología a mano. |
When It Is No Longer Limited to a Single Type of DataMultimodal AI is not an isolated fourth type, but rather the ability to combine the previous capabilities within the same model: it can receive text, images, audio, or video as input and, depending on its capabilities, produce output in one or more of those modalities. Unlike traditional models designed for a single type of data, a multimodal model can, for example, receive a photograph of a landscape and generate a written summary of its characteristics, or receive a written description and generate an image from it. This is something I use myself quite often: I upload a photograph of a plant with unusual symptoms on its leaves and ask a model to help me narrow down possible causes—pests, nutrient deficiencies, excessive watering—before I go and review specific literature. The model does not see the image the way an experienced agronomist would, but it can describe visual patterns, such as interveinal chlorosis, necrotic spots, or leaf deformation, and connect them with what it knows from text. It does not replace a real diagnosis, but it speeds up the initial elimination process, especially when I do not have a plant pathology book at hand. |

Vale aclarar que multimodal se refiere a procesar e integrar múltiples tipos de datos, mientras que generativa se refiere a la capacidad de crear contenido nuevo. Un modelo puede ser multimodal sin ser generativo (por ejemplo, uno que solo clasifica imágenes médicas), y puede ser generativo sin ser multimodal (como las primeras generaciones de GPT orientadas al procesamiento de texto). Los modelos más avanzados del mercado combinan ambas cosas: entienden múltiples formatos y generan contenido nuevo en cualquiera de ellos. |
It is worth clarifying that multimodal refers to processing and integrating multiple types of data, whereas generative refers to the ability to create new content. A model can be multimodal without being generative—for example, one that only classifies medical images—and it can be generative without being multimodal, as with early generations of GPT focused on text processing. The most advanced models on the market combine both capabilities: they understand multiple formats and generate new content in one or more of them. |

Por qué te importa como usuarioNo necesitas memorizar cómo funciona internamente cada arquitectura para escribir buenos prompts. Pero sí necesitas saber antes qué tipo de modelo tienes enfrente, porque eso determina qué información vale la pena incluir. Con texto, tu trabajo es dar contexto e instrucciones claras en lenguaje natural. Con imagen, tu trabajo incluye pensar en términos visuales —composición, estilo, iluminación— y no dar por sentado que el modelo va a inferir adecuadamente lo que esperabas a partir de descripciones vagas. Con código, tu trabajo es eliminar ambigüedad, y con multimodal, tu trabajo es decidir qué modalidad de entrada le da al modelo la información más útil para la tarea, en vez de forzarlo todo a texto cuando una imagen lo resolvería con menor esfuerzo. En el próximo artículo entramos a los primeros prompts, y los errores más comunes que se cometen al empezar. Nos vemos. |
Why This Matters to You as a UserYou do not need to memorize how every architecture works internally in order to write good prompts. But you do need to know what type of model you are dealing with first, because that determines which information is worth including. With text, your job is to provide context and clear instructions in natural language. With images, your job also involves thinking in visual terms—composition, style, lighting—and not assuming that the model will correctly infer what you expected from vague descriptions. With code, your job is to eliminate ambiguity. And with multimodal AI, your job is to decide which input modality gives the model the most useful information for the task, instead of forcing everything into text when an image could solve it with less effort. In the next article, we will get into your first prompts and the most common mistakes people make when getting started. See you there. |

- Javadex. "IA Multimodal: Qué Es, Cómo Funciona y Mejores Modelos en 2026." https://www.javadex.es/blog/ia-multimodal-que-es-como-funciona-guia-completa-2026
- GetGuru. "IA multimodal: La siguiente evolución de la inteligencia artificial." https://www.getguru.com/es/reference/multimodal-ai
- IBM. "¿Qué es la IA multimodal?" https://www.ibm.com/es-es/think/topics/multimodal-ai
- Ultralytics. "Modelos de difusión: IA generativa explicada." https://www.ultralytics.com/es/blog/what-are-diffusion-models-a-quick-and-comprehensive-guide
- DesignerBox. "¿Qué son los Modelos de Difusión? Guía Completa." https://designerbox.ai/es-es/glossary/diffusion-model
- Aprender21. "Qué es la IA Generativa: Guía Completa con Ejemplos 2026." https://www.aprender21.com/blog/que-es-ia-generativa

|
Todas las imágenes son de mi propiedad / generadas por IA, a menos que se indique lo contrario. Texto original en español, traducido al inglés con asistencia de Claude. |
All images are my own / AI-generated, unless otherwise noted. Original text in Spanish, translated to English with Claude's assistance. |




