¿PUEDE UNA INTELIGENCIA ARTIFICIAL COMPRENDER EL LENGUAJE O SOLO PREDECIR PALABRAS?

¿Puede una inteligencia artificial comprender el lenguaje o solo predecir palabras?

23 de septiembre del 2026

Introducción

Una pregunta que parece sencilla

Cuando una inteligencia artificial responde alguna pregunta, explica un concepto, resume un libro o mantiene cualquier conversación, resulta difícil no atribuirle alguna forma de comprensión. El lenguaje que produce tiene estructura, continuidad y, en muchos casos, una sorprendente sensibilidad al contexto. Sin embargo, los grandes modelos de lenguaje (LLM) se entrenan mediante un objetivo que, formulado de manera sencilla, parece mucho más limitado: predecir qué token viene a continuación a partir del contexto anterior.

De ahí surge una de las preguntas fundamentales sobre la inteligencia artificial generativa: ¿Comprende realmente el lenguaje o simplemente ha aprendido a predecir palabras con una precisión extraordinaria?

La dicotomía, sin embargo, es menos sencilla de lo que parece. La predicción estadística y la comprensión no son necesariamente procesos incompatibles. De hecho, investigaciones recientes muestran que la predicción constituye una parte importante tanto del procesamiento lingüístico humano como del funcionamiento de los modelos de lenguaje. El problema consiste en determinar qué tipo de representación del significado emerge de ese proceso y hasta dónde llega.

La cuestión conecta directamente con otros debates de El Observatorio: si una imagen no es la realidad que representa, como analizamos en “¿Por qué una imagen puede decir más que mil palabras?”, tampoco una secuencia de palabras generada por una máquina equivale necesariamente al significado que esas palabras tienen para quien las utiliza. Y, como planteábamos en “¿Puede una inteligencia artificial entender una imagen?”, reconocer estructuras no implica automáticamente comprender aquello a lo que remiten.



¿Qué significa realmente “predecir palabras”?

Los modelos de lenguaje generativos no trabajan con palabras exactamente como las encontramos en un diccionario. El texto se divide en tokens, unidades que pueden corresponder a palabras completas, fragmentos de palabras, signos o combinaciones frecuentes. Durante el entrenamiento, el modelo aprende a estimar qué token resulta más probable dado un contexto.

Si recibe “El médico examinó al paciente y después…”, debe calcular qué continuación resulta más probable entre las muchas posibles.

La operación matemática es extremadamente sofisticada. La arquitectura Transformer utiliza mecanismos de atención para relacionar diferentes elementos del contexto y construir representaciones vectoriales que cambian según la situación lingüística. Por eso una palabra como “banco” adquiere representaciones contextuales diferentes en “me senté en el banco” y “fui al banco a ingresar dinero”.

La descripción “solo predice palabras” es, por tanto, técnicamente correcta pero insuficiente. El problema no está en la palabra predicción, sino en el significado que damos a solo.

De la predicción estadística a las representaciones del significado

Predecir exige aprender regularidades

Para predecir correctamente no basta con memorizar qué palabra suele aparecer después de otra. El modelo debe incorporar regularidades sintácticas, relaciones semánticas, estructuras discursivas y dependencias que pueden extenderse a lo largo de grandes cantidades de contexto.

Esto explica una aparente paradoja: la tarea de entrenamiento relativamente simple produce capacidades extraordinariamente complejas.

La investigación sobre modelos de lenguaje muestra que sus representaciones internas contienen información lingüística de distintos niveles. Trabajos recientes incluso han encontrado correspondencias entre la organización jerárquica de estas representaciones y múltiples patrones de procesamiento del lenguaje en el cerebro humano.

Cómo un modelo de lenguaje procesa el contexto y predice el siguiente token

Pero esta evidencia debe interpretarse con cuidado. Que dos sistemas utilicen representaciones o estrategias computacionales parcialmente semejantes no demuestra que tengan la misma experiencia subjetiva ni que comprendan de la misma manera.

El lenguaje humano tampoco funciona sin predicción

Aquí aparece una cuestión especialmente interesante. La predicción no es una característica exclusiva de la inteligencia artificial.

Cuando una persona escucha cualquier frase, anticipa continuamente lo que probablemente vendrá después. La neurociencia del lenguaje ha encontrado evidencias de predicción de palabras y oraciones en distintos niveles temporales durante la comprensión narrativa.

Un estudio publicado en Nature Neuroscience encontró además correlación considerable entre las predicciones de palabras realizadas por personas y las generadas por GPT-2 en determinados contextos narrativos.

Por lo tanto, afirmar que una IA “solo predice palabras” no resuelve el problema. Los seres humanos también predicen lenguaje. La diferencia está en qué más interviene en nuestra relación con él.

Comprender no es únicamente completar una frase

Un humano que entiende “El vaso cayó al suelo y se rompió” no se limita a identificar una continuación lingüísticamente probable. Relaciona la frase con conocimientos sobre objetos, gravedad, causalidad, fragilidad y acontecimientos físicos. Además, puede situarla dentro de la experiencia, imaginar la escena, interpretar quién es responsable, detectar ironía o comprender que alguien está mintiendo.

Esto introduce una distinción fundamental entre competencia lingüística y comprensión situada.

Los LLM resuelven tareas que requieren inferencias, reconocer relaciones semánticas, interpretar determinados usos pragmáticos y mantener coherencia contextual. Algunos estudios recientes han encontrado incluso un rendimiento muy elevado de modelos avanzados en diversos pruebas de pragmática lingüística.

Pero otras investigaciones muestran limitaciones importantes. Por ejemplo, los modelos no distinguen de manera fiable en todos los casos entre conocimiento, creencia, ficción y hecho, una capacidad especialmente relevante cuando las respuestas se utilizan en contextos de decisión.

La conclusión razonable no es que “no entienden nada”, sino que su comprensión no debe identificarse sin más con la comprensión humana.

¿Tiene significado una palabra para una máquina?

Aquí entramos en un problema filosófico. Para el humano, el significado de una palabra no se reduce a la relación con otras palabras. “Mar”, por ejemplo, está vinculado con percepciones, recuerdos, experiencias corporales, conocimientos, emociones, imágenes y prácticas sociales.

Un modelo lingüístico obtiene información principalmente de regularidades presentes en los datos con los que ha sido entrenado, las representaciones son matemáticas y distribucionales: el significado se relaciona con los patrones de uso que aparecen en el lenguaje.

Esto recuerda, aunque desde una perspectiva completamente distinta, una cuestión que abordamos en “¿Vemos la realidad o la interpretamos?”: nunca accedemos a la realidad sin algún sistema de representación.

La cuestión decisiva para la IA es entonces qué clase de relación existe entre representación lingüística y mundo.

El problema del anclaje

Un modelo puede generar una descripción extraordinariamente precisa, por ejemplo, de una manzana… sin haber tocado jamás una manzana. Llegar a explicar textura, sabor, color o incluso escribir un poema sobre ella.

Esto conduce al conocido problema del anclaje del significado (symbol grounding problem): ¿Cómo adquieren los símbolos significado si no están vinculados de alguna manera con aquello que representan?

Los modelos multimodales complican el panorama porque ya no trabajan exclusivamente con texto, procesan imágenes, audio, vídeo y otras modalidades, estableciendo relaciones entre diferentes tipos de representación. La investigación reciente incluso estudia cómo la predicción del siguiente token se extiende a sistemas multimodales.

Aun así, disponer de más modalidades no demuestra la existencia de cierta experiencia subjetiva o de una comprensión idéntica a la humana.

El lenguaje como mapa, no como territorio

Aquí resulta especialmente pertinente Alfred Korzybski y su conocida formulación: “el mapa no es el territorio”.

El lenguaje representa, clasifica y organiza la experiencia, pero no es aquello que representa. Esta distinción también resulta útil para pensar los modelos generativos.

Un LLM construye representaciones extremadamente sofisticadas de regularidades lingüísticas. Podría producir un mapa extraordinariamente detallado de cómo los seres humanos hablamos sobre el mundo. Pero ese mapa, por detallado que sea, no debe confundirse con el territorio.

El lenguaje como mapa y su relación con la realidad en la inteligencia artificial

Esta cuestión enlaza con “¿Cómo sabe la ciencia lo que ve?”, donde analizamos cómo toda observación científica implica procedimientos de representación, selección y construcción del conocimiento.

La IA introduce una nueva vuelta de tuerca: ahora tenemos máquinas capaces de manipular representaciones lingüísticas del mundo a una escala y velocidad desconocidas hasta hace poco.

¿Entonces los LLM comprenden?

La respuesta depende de qué llamemos comprender. Si comprender significa identificar relaciones entre palabras, estructuras sintácticas, referencias contextuales, regularidades semánticas e implicaciones pragmáticas, existe evidencia considerable de que los modelos actuales desarrollan capacidades que justifican hablar, al menos, de formas funcionales de comprensión lingüística.

Si comprender significa poseer una experiencia consciente del significado, una relación corporal con el mundo, intenciones propias o una perspectiva subjetiva comparable a la humana, las evidencias disponibles no permiten afirmarlo.

Por eso conviene abandonar dos posiciones igualmente simplificadoras. La primera sostiene que un modelo “solo predice palabras” y, por tanto, todo lo que hace es trivial. La segunda interpreta la fluidez lingüística como demostración suficiente de comprensión humana.

Entre ambas existe una posición científicamente más prudente: la predicción del siguiente token constituye un mecanismo de entrenamiento capaz de generar representaciones internas sorprendentemente ricas, pero todavía no sabemos si esas representaciones equivalen a comprensión en el sentido fuerte del término.

Una cuestión que también afecta a nuestra propia idea de inteligencia

La discusión tiene una consecuencia filosófica más profunda. Durante mucho tiempo hemos tendido a considerar el lenguaje como una de las pruebas privilegiadas de inteligencia. Si una máquina conversa, argumenta, explica, escribe y responde preguntas, resulta intuitivo atribuirle una mente semejante a la nuestra.

Los LLM obligan a revisar esa intuición. Su existencia demuestra que determinadas competencias que asociábamos estrechamente con la comprensión humana pueden emerger de mecanismos de aprendizaje estadístico a gran escala. Pero también muestra que quizá habíamos simplificado nuestra propia inteligencia: los seres humanos tampoco producen lenguaje desde cero. Anticipamos, recordamos, inferimos, imitamos, corregimos y utilizamos patrones adquiridos socialmente.

Diferencia entre lenguaje generado y comprensión humana en la inteligencia artificial

La diferencia no consiste simplemente en predecir o no predecir. La cuestión más interesante es qué representamos, cómo relacionamos esas representaciones con el mundo y qué clase de sistema cognitivo las utiliza.

Conclusiones: entre el cálculo y el significado

La inteligencia artificial generativa no puede reducirse a un autocompletado sofisticado, aunque la predicción del siguiente token sea una pieza fundamental de su funcionamiento. Para alcanzar su extraordinario rendimiento lingüístico, los modelos desarrollan representaciones contextuales y relaciones estadísticas de una complejidad que excede ampliamente la simple asociación entre palabras consecutivas. Pero tampoco disponemos de razones suficientes para afirmar que esas capacidades equivalen a la comprensión humana.

Quizá la pregunta correcta no sea “¿comprende o no comprende?”. Conviene formularla de manera más precisa: ¿Qué tipo de comprensión emerge de un sistema que aprende a representar regularidades del lenguaje mediante predicción estadística?

La respuesta sigue abierta. Y precisamente ahí reside una de las cuestiones intelectualmente más fértiles de la inteligencia artificial: comprender cómo la operación matemática aparentemente limitada produce comportamientos que, desde fuera, se parecen cada vez más a los de una mente.

Como ocurre con cualquier mapa, lo decisivo no es únicamente su precisión. También importa saber qué representa, qué deja fuera y qué confundimos con el territorio.

 

FAQ

¿ChatGPT solo predice la siguiente palabra?

No exactamente. Los modelos autorregresivos se entrenan para predecir el siguiente token, pero para hacerlo desarrollan representaciones contextuales de gran complejidad. Reducir su funcionamiento a una simple sucesión de palabras sería técnicamente insuficiente.

¿Los modelos de lenguaje entienden el significado?

Presentan capacidades funcionales relacionadas con la semántica, la sintaxis y la pragmática, pero no existe consenso científico que permita equiparar esas capacidades con la comprensión humana consciente y situada.

¿Por qué una IA puede parecer que comprende?

Porque sus representaciones internas capturan numerosas regularidades del lenguaje y del conocimiento expresado mediante él. Cuando esas regularidades se combinan con contexto y generación probabilística, el resultado puede producir respuestas coherentes y aparentemente intencionales.

¿Los seres humanos también predicen palabras?

Sí. La investigación neurocientífica ha encontrado evidencias de predicción lingüística durante la comprensión humana. La diferencia está en que la actividad lingüística humana forma parte de un sistema cognitivo, corporal, perceptivo y social mucho más amplio.

¿La IA generativa llegará a comprender como una persona?

No existe una respuesta científica establecida. Los avances actuales permiten estudiar cada vez mejor las capacidades internas de los modelos, pero no justifican convertir su competencia lingüística en una prueba de conciencia o experiencia subjetiva.


Referencias bibliográficas

Bender, E. M., & Koller, A. (2020). Climbing towards NLU: On meaning, form, and understanding in the age of data. Proceedings of ACL 2020, 5185–5198.

Fedorenko, E., Piantadosi, S. T., & Gibson, E. (2024). Language is primarily a tool for communication rather than thought. Nature, 630, 575–586.

Goldstein, A., Zada, Z., Buchnik, E., et al. (2022). Shared computational principles for language processing in humans and deep language models. Nature Neuroscience, 25, 369–378.

He, H., & Su, W. J. (2024). A law of next-token prediction in large language models. arXiv preprint.

Liu, W., Xiang, M., & Ding, N. (2026). Active use of latent tree-structured sentence representation in humans and large language models. Nature Human Behaviour, 10, 303–316.

Steyvers, M., Tejeda, H., Kumar, A., et al. (2025). What large language models know and what people think they know. Nature Machine Intelligence, 7, 221–231.

Suzgun, M., Gur, T., Bianchi, F., et al. (2025). Language models cannot reliably distinguish belief from knowledge and fact. Nature Machine Intelligence, 7, 1780–1790.


¿Dónde termina la predicción y comienza la comprensión?

En El Observatorio seguimos explorando las preguntas que surgen cuando la inteligencia artificial empieza a ocupar espacios que antes considerábamos exclusivamente humanos.

Lee más sobre inteligencia artificial, lenguaje, percepción y conocimiento en El Observatorio de Momento Presente →


Productos relacionados


2d7d3fce-29ad-45bd-9340-4361c3148fc5

Camiseta «Soy la Onomatopeya» – Rana, Lenguaje y Humor

Ver producto →

d094eacb-5114-414f-b16c-4056640b774b

Camiseta unisex premium de manga corta – El algoritmo no sueña | Inteligencia artificial y filosofía

Ver producto →

b691f882-692d-4116-afa3-1c934065f45a

Camiseta de Ciencia Ficción «Ayúdame, eres mi única esperanza»

Ver producto →