← Todos los artículos

IA explicada

¿La IA es realmente nueva? Una historia de ideas que se vuelven útiles

Un recorrido breve por las ideas detrás de la inteligencia artificial, lo que cambió en el camino y por qué una nueva capacidad no equivale a un sistema confiable.

Reescrito a partir de AI: Is it really something new? A brief chronology (se abre en una pestaña nueva) · .

Imagina que le haces una pregunta a una máquina y te responde con una explicación razonable. Hay algo que no entiendes, así que se lo dices, y te lo explica de otra manera. Después le pides un ejemplo. La conversación continúa con tanta naturalidad que, por un momento, resulta fácil olvidarse de todo lo que tuvo que ocurrir para que pudieras estar haciendo eso.

¿La inteligencia artificial es realmente nueva? La respuesta corta es no, pero entiendo la sorpresa. Esa era precisamente la inquietud detrás de mi primera cronología, publicada en 2023 (Acosta Pereira, 2023 (se abre en una pestaña nueva)). OpenAI había presentado ChatGPT el 30 de noviembre de 2022, con una propuesta que invitaba a conversar con el sistema (OpenAI, 2022 (se abre en una pestaña nueva)). Frente a una experiencia así, la pregunta casi se hace sola: ¿en qué momento aprendieron las máquinas a hacer esto?

Para responder, vamos a alejarnos un rato de esa pantalla. Nos esperan una pregunta escrita décadas antes, redes que aprenden de sus errores y un tablero de Go. Seguiremos una dificultad que se irá transformando: cómo enseñar a una máquina algo que no sabemos describirle con todas sus reglas. La veremos al reconocer imágenes, elegir jugadas y trabajar con el lenguaje. Es un recorrido selectivo: esos trabajos se solapan, y ninguno explica por sí solo la historia de la IA. Cuando volvamos a la conversación del principio, podremos reconocer mejor cuánto de esta historia ya estaba en marcha antes de que la viéramos aparecer en un chat.

Una línea conecta un cuaderno con un boceto de nodos, una computadora antigua y una laptop con globos de conversación.

De las ideas en papel a una conversación en pantalla: una ilustración conceptual del recorrido que vamos a explorar.

Antes de la interfaz, hubo una pregunta

En 1950, Alan Turing publicó en la revista Mind un artículo cuya primera frase nos deja directamente frente al problema:

«I propose to consider the question, “Can machines think?”»

Turing (1950, p. 433) (se abre en una pestaña nueva)

En español: «Me propongo considerar la pregunta: “¿Pueden pensar las máquinas?”» (traducción para esta versión). Sí, en 1950. Piensa por un momento en la distancia entre escribir esa pregunta y poder hacerle hoy una consulta a un chatbot desde el teléfono.

Turing propuso abordarla mediante un juego de imitación y también exploró cómo construir máquinas capaces de aprender. Hacia el final del artículo consideró tanto el ajedrez como la posibilidad de enseñar a una máquina a comprender y hablar inglés (Turing, 1950, pp. 459–460 (se abre en una pestaña nueva)). Leído desde el presente, ese pasaje tiene algo que invita a levantar la vista del papel: acabamos de empezar nuestra historia y ya aparecen el lenguaje y los juegos.

Ahora bien, no voy a resolver aquí si las máquinas piensan. Lo que sí podemos hacer es seguir la pista de esas capacidades. ¿Cómo pasamos de imaginar una máquina que aprende a construir sistemas que reconocen imágenes, eligen una jugada o responden una pregunta? Para encontrar algunas piezas de la respuesta, tenemos que retroceder incluso un poco más que Turing.

Una breve cronología de posibilidades que van cambiando

Primero había que encontrar cómo aprender

En 1943, Warren McCulloch y Walter Pitts tomaron una idea de la biología —las neuronas reciben señales y se conectan entre sí— y la llevaron a un modelo matemático. Sus unidades simplificadas se activaban al alcanzar un umbral de señales excitadoras, siempre que ninguna señal inhibidora lo impidiera. Al conectarse, podían representar operaciones lógicas. Aquí encontramos una de las raíces de las redes neuronales artificiales: estudiar qué pueden hacer muchas unidades sencillas trabajando juntas (McCulloch & Pitts, 1943 (se abre en una pestaña nueva)). Conectar unidades capaces de realizar operaciones lógicas era un punto de partida; conseguir que una máquina aprendiera o conversara planteaba otros problemas.

Aprender y conversar eran precisamente dos de las capacidades que otros investigadores querían estudiar, más allá de un modelo concreto de neuronas. En 1955, el matemático John McCarthy y otros tres colegas propusieron un encuentro en Dartmouth College, una institución universitaria de Hanover, en New Hampshire, Estados Unidos. Dedicarían el verano de 1956 a explorar cómo lograr que las máquinas usaran el lenguaje, aprendieran y resolvieran problemas. La propuesta de Dartmouth ya utilizaba el término inteligencia artificial (McCarthy et al., 1955 (se abre en una pestaña nueva)). De esa agenda, quedémonos primero con el aprendizaje: ¿qué significaría enseñar algo a una máquina?

Imagina que queremos enseñarle a distinguir una figura de otra. Podemos intentar escribir cada regla de reconocimiento, o mostrarle ejemplos y buscar una forma de que ajuste sus respuestas. Esta segunda posibilidad nos lleva del modelo de conexiones de McCulloch y Pitts al problema de cómo modificarlas. En 1958, Frank Rosenblatt describió el perceptrón, un modelo inspirado en el sistema nervioso cuyas respuestas podían cambiar con la experiencia (Rosenblatt, 1958 (se abre en una pestaña nueva)). El ajuste de las conexiones daba una forma concreta a esa idea de aprender de la experiencia.

A ese aprendizaje a partir de datos o experiencia lo llamamos aprendizaje automático (machine learning). Conviene situarlo dentro de la IA, el campo más amplio al que se refería la propuesta de Dartmouth. El aprendizaje profundo (deep learning) es una parte del aprendizaje automático, con múltiples capas de representación (Goodfellow et al., 2016, cap. 1 (se abre en una pestaña nueva)). La distinción importa para lo que sigue: no todos los sistemas de IA aprenden, ni todo el aprendizaje automático utiliza redes neuronales.

La diferencia se aprecia bien en los programas de conversación. Para dar la impresión de dialogar también se podía recurrir a reglas escritas por una persona, sin aprender de ejemplos. En 1966, Joseph Weizenbaum presentó ELIZA, un programa que transformaba frases mediante palabras clave y reglas. Uno de sus guiones simulaba las respuestas de un psicoterapeuta. Weizenbaum señalaba que el interlocutor podía atribuirle conocimientos y comprensión que él mismo aportaba a la conversación (Weizenbaum, 1966 (se abre en una pestaña nueva)). ELIZA nos deja una precaución que conviene llevar durante el recorrido: una respuesta convincente puede decirnos menos de lo que parece sobre el mecanismo que la produce.

Volvamos al perceptrón: que pudiera aprender de ejemplos no significaba que pudiera resolver cualquier problema. En 1969, Marvin Minsky y Seymour Papert examinaron esos límites en su libro Perceptrons. Demostraron que los modelos de perceptrón que estudiaban no podían resolver ciertos problemas debido a su estructura. La conclusión se refería a esos modelos concretos; no era una demostración de que todas las redes neuronales tuvieran las mismas limitaciones (Minsky & Papert, 1969 (se abre en una pestaña nueva)).

La influencia del libro en la investigación es una cuestión distinta. A menudo se lo presenta como la causa de que las redes neuronales perdieran apoyo, pero esa explicación está discutida: también intervinieron decisiones sobre qué líneas de investigación impulsar y cuáles financiar (Olazaran, 1996 (se abre en una pestaña nueva)). Para entender ese período, necesitamos mirar tanto los resultados científicos como las condiciones en que se investigaba.

Un escritorio con un cuaderno abierto y una lámpara encendida junto a una ventana de invierno.

El trabajo que continúa. Ilustración conceptual.

Los inviernos no detuvieron todas las ideas

Las instituciones que financiaban la investigación también evaluaban qué estaba consiguiendo la IA en su conjunto. En 1973, un informe encargado a James Lighthill por el Science Research Council, un organismo británico de financiamiento científico, cuestionó los resultados de la IA, entre otras razones porque las posibilidades por explorar crecían demasiado rápido al aumentar el tamaño de los problemas (Lighthill, 1973 (se abre en una pestaña nueva)). Los recortes de apoyo de los años setenta en el Reino Unido y Estados Unidos tuvieron causas y trayectorias distintas. Hoy se agrupan retrospectivamente bajo la expresión invierno de la IA, aunque la investigación continuara (Hendler, 2008 (se abre en una pestaña nueva); National Research Council, 1999 (se abre en una pestaña nueva)). La nota 1 distingue esas decisiones de financiamiento.

El trabajo que continuó durante esos años no dependía solo de conseguir que las redes aprendieran. Si el problema podía delimitarse y el conocimiento expresarse en reglas, los sistemas expertos ofrecían otra vía para construir herramientas útiles. John McDermott documentó en 1982 cómo R1 ayudaba a Digital Equipment Corporation a configurar pedidos de computadoras y determinar cómo conectar sus componentes (McDermott, 1982 (se abre en una pestaña nueva)). Aquí la utilidad venía de organizar conocimiento especializado en reglas. En las redes de varias capas, la dificultad era otra: cómo ajustar las conexiones a partir de los errores.

Para ver la dificultad, pensemos en una red con varias capas: la respuesta final depende de lo que ocurre en todas ellas. Si esa respuesta es incorrecta, ¿cuánto debe cambiar cada conexión, incluidas las que están lejos de la salida? En 1986, David Rumelhart, Geoffrey Hinton y Ronald Williams mostraron cómo usar el error para calcular ajustes en las conexiones mediante retropropagación, o backpropagation. Los valores numéricos de esas conexiones, llamados pesos, determinan cuánto influye una unidad en otra (Rumelhart et al., 1986 (se abre en una pestaña nueva)). El error proporcionaba una señal para aprender representaciones internas útiles. El trabajo fue un hito de difusión, con antecedentes que detallo en la nota 2.

Ese avance técnico convivió con otro invierno hacia finales de los ochenta. James Hendler describió una mezcla de recortes previos, tensiones alrededor de los sistemas expertos y computadoras especializadas que perdían mercado frente a equipos más baratos (Hendler, 2008 (se abre en una pestaña nueva)). Un resultado de laboratorio y un sector comercial podían estar atravesando momentos muy distintos.

La investigación que continuaba nos acerca a otra exigencia de una conversación: recordar el contexto. Cuando leemos una frase, interpretamos cada palabra con ayuda de lo que ya hemos leído, a veces bastante antes. En los noventa, conseguir que una red aprendiera esas relaciones seguía siendo un problema. Las redes recurrentes mantienen un estado interno al recorrer una secuencia, pero la señal usada para ajustar sus pesos podía debilitarse al propagarse por muchos pasos: el gradiente que se desvanece (Bengio et al., 1994 (se abre en una pestaña nueva)). En 1997, Sepp Hochreiter y Jürgen Schmidhuber presentaron LSTM, siglas de long short-term memory, para facilitar el aprendizaje de esas dependencias lejanas (Hochreiter & Schmidhuber, 1997 (se abre en una pestaña nueva)).

Mientras las LSTM abordaban esa dificultad con las secuencias, otra de las tareas que Turing había mencionado ofrecía un resultado mucho más visible. Ese mismo 1997, en el ajedrez, Deep Blue, de IBM, derrotó al campeón mundial Garry Kasparov en un encuentro de seis partidas. Su equipo describió años después un sistema de búsqueda, hardware especializado, evaluación de posiciones y bases de partidas de grandes maestros (Campbell et al., 2002 (se abre en una pestaña nueva)). LSTM y Deep Blue compartían un año, pero resolvían problemas distintos con técnicas distintas. «IA» nunca ha sido el nombre de una sola receta.

De reconocer una imagen a elegir una jugada

Una victoria en ajedrez no agotaba las tareas pendientes. Basta pensar en algo tan cotidiano como mirar una fotografía y decir qué aparece en ella. Para abordar el reconocimiento de imágenes con redes profundas, había que entrenar sus múltiples capas. Ya hemos visto la retropropagación; se investigaban también otras formas de hacerlo. En 2006, Geoffrey Hinton, Simon Osindero y Yee-Whye Teh propusieron aprender capa por capa en un tipo concreto de red profunda, las redes de creencia profunda (Hinton et al., 2006 (se abre en una pestaña nueva)). «Profunda» se refiere aquí a múltiples capas de procesamiento. Ese procedimiento fue una vía de investigación; la red de reconocimiento visual que veremos enseguida utilizó otra forma de entrenamiento.

Para comprobar lo que una red podía aprender de una fotografía hacía falta algo más que un método de entrenamiento: imágenes con las que enseñarle y evaluar sus respuestas. ¿Quién reunía esos ejemplos y decidía qué contenían? En 2009, Jia Deng y sus colegas presentaron ImageNet: imágenes recogidas de la web, organizadas por categorías y verificadas mediante trabajo humano (Deng et al., 2009 (se abre en una pestaña nueva)). El aprendizaje de la máquina descansaba, así, en decisiones y trabajo de personas que preparaban sus ejemplos.

ImageNet dio una escala concreta a esa tarea de reconocimiento. En 2012, Alex Krizhevsky, Ilya Sutskever y Geoffrey Hinton entrenaron una red convolucional profunda —capas que aprenden patrones visuales— con dos procesadores gráficos, o GPU. Esa arquitectura se conoce como AlexNet. Para el concurso de reconocimiento visual ILSVRC-2012 combinaron las predicciones de siete redes convolucionales entrenadas por separado, incluidas variantes de la red. Ese ensamblado alcanzó un 15,3 % de error top-5, frente al 26,2 % del segundo clasificado. Top-5 significa que se cuenta un error cuando la categoría correcta no aparece entre las cinco propuestas del sistema (Krizhevsky et al., 2012 (se abre en una pestaña nueva)). No era el entrenamiento capa por capa de 2006: aquí se usaban retropropagación, funciones de activación y técnicas para reducir el sobreajuste, es decir, aprender demasiado las particularidades de los ejemplos de entrenamiento.

Reconocer patrones también podía ayudar a decidir qué hacer. En un tablero, por ejemplo, interesa evaluar una posición y elegir la siguiente jugada; describir lo que se ve es solo una parte del trabajo. AlphaGo, un programa para jugar al Go —un juego de estrategia—, reunió redes neuronales, búsqueda de posibles jugadas y aprendizaje por refuerzo: entrenamiento mediante señales de recompensa, en este caso aprendiendo también de partidas contra sí mismo. El artículo de 2016 documentó una victoria de 5–0 frente a Fan Hui, campeón europeo, en un encuentro disputado en octubre de 2015 (Silver et al., 2016 (se abre en una pestaña nueva)). Las redes ayudaban a proponer movimientos y evaluar posiciones para orientar una búsqueda que no podía examinar todas las continuaciones.

La comparación con Deep Blue muestra cómo una misma tarea —elegir una jugada— podía abordarse con combinaciones de técnicas distintas. En AlphaGo, además, el resultado de jugar proporcionaba una señal para aprender. Más adelante veremos cómo llevar esa idea al lenguaje, donde valorar una respuesta exige algo distinto de contar victorias.

Un tablero de Go con piedras negras y blancas, fotografías y un cuaderno sobre una mesa.

Antes de la próxima jugada. Ilustración conceptual.

El lenguaje nos devuelve a la pantalla

Para llegar a una máquina que converse, necesitamos recuperar el trabajo sobre lenguaje que avanzaba en paralelo a los juegos. Las LSTM habían abordado cómo aprender relaciones entre partes distantes de una secuencia; traducir una frase era una tarea donde esas relaciones importaban. Volvamos a 2014, cuando el trabajo de Ilya Sutskever, Oriol Vinyals y Quoc Le mostró cómo una red LSTM podía codificar una frase y otra producir su traducción: aprendizaje de secuencia a secuencia, o seq2seq (Sutskever et al., 2014 (se abre en una pestaña nueva)).

En esa traducción, la frase original se codificaba en una representación de tamaño fijo. Pensemos en una oración larga: al escribir una palabra de la traducción, sería útil consultar la parte del original que hace falta en ese momento. También en 2014, Dzmitry Bahdanau, Kyunghyun Cho y Yoshua Bengio difundieron una propuesta que permitía ponderar distintas partes de la frase original al generar cada palabra. El trabajo se presentó en el congreso ICLR 2015 (Bahdanau et al., 2015 (se abre en una pestaña nueva); prepublicación de 2014 (se abre en una pestaña nueva)). Ese mecanismo de atención permitía consultar distintas partes del original en lugar de depender de una única representación fija.

Consultar distintas partes del texto resultó ser una idea que podía ocupar un lugar mucho mayor en el diseño. En 2017, Attention is all you need presentó el Transformer, una arquitectura que organiza el procesamiento de secuencias alrededor de la atención y prescinde de las conexiones recurrentes que recorren el texto paso a paso. Los experimentos se centraban en traducción (Vaswani et al., 2017 (se abre en una pestaña nueva)). La atención ya tenía antecedentes; lo que cambiaba era su papel en la arquitectura y la forma de organizar el cómputo.

Con esa familia de arquitecturas, trabajar con lenguaje podía tomar formas distintas de la traducción. BERT, desarrollado por Jacob Devlin y sus colegas, aprovechó el contexto a ambos lados de una palabra para aprender representaciones que después podían ajustarse a tareas como responder preguntas sobre un pasaje. Su prepublicación apareció en 2018 y su artículo de congreso en 2019 (Devlin et al., 2019 (se abre en una pestaña nueva)).

Podemos cambiar ahora la tarea: en vez de examinar una palabra con texto a ambos lados, intentemos continuar lo que ya está escrito. Esa era otra manera de aprovechar la familia Transformer. En 2019, OpenAI presentó GPT-2, que aprendía a predecir la siguiente parte de un texto a partir de lo anterior y podía generar continuaciones de varios párrafos (Radford et al., 2019 (se abre en una pestaña nueva)). El gesto empieza a resultarnos familiar: escribimos un comienzo y esperamos a ver cómo sigue.

Ese comienzo podía contener algo más que una frase por terminar: también podía mostrar qué queríamos obtener. En 2020, el equipo de OpenAI mostró con GPT-3 cómo proporcionar instrucciones y ejemplos dentro del texto de entrada, sin volver a entrenar el modelo para cada tarea (Brown et al., 2020 (se abre en una pestaña nueva)). Si alguna vez has escrito «quiero algo como esto» y has añadido un ejemplo, la conexión resulta bastante cercana.

Ahora bien, los ejemplos que escribimos en una consulta no son lo mismo que el material con el que se entrenó el modelo. Para llegar a responder de esa manera, GPT-3 se entrenó con una mezcla de páginas web, libros y Wikipedia; elegir y filtrar ese material era parte de construir el modelo (Brown et al., 2020, sección 2.2 (se abre en una pestaña nueva)). En 2022, el estudio de Chinchilla examinó cómo repartir un presupuesto de cómputo entre el tamaño del modelo y la cantidad de texto de entrenamiento: aumentar los parámetros sin suficientes datos dejaba rendimiento sin aprovechar (Hoffmann et al., 2022 (se abre en una pestaña nueva)). La escala incluía decisiones sobre qué leer y cuánto entrenar, además de cuántos parámetros usar.

Elegir los datos y el tamaño del modelo ayudaba a entrenarlo; quedaba, además, el problema que notamos como usuarios: continuar un texto no garantiza seguir lo que alguien pide. En 2022, Long Ouyang y sus colegas de OpenAI presentaron InstructGPT: primero hacían un ajuste supervisado del modelo con ejemplos de respuestas escritas por personas; después usaban comparaciones humanas para entrenar un modelo de recompensa y mejorar las respuestas mediante refuerzo. Es el aprendizaje por refuerzo con feedback humano, o RLHF (Ouyang et al., 2022 (se abre en una pestaña nueva)). La señal de aprendizaje ahora incluía preferencias sobre las respuestas, en lugar del resultado de una partida.

Así llegamos de nuevo al 30 de noviembre de 2022. El anuncio de ChatGPT describió un entrenamiento relacionado, adaptado al diálogo con demostraciones de conversaciones y RLHF (OpenAI, 2022 (se abre en una pestaña nueva)). Ya estamos frente a la pantalla del principio: «explícamelo de otra manera» puede ser nuestro siguiente mensaje. Esa facilidad tenía detrás cambios en el entrenamiento, además de una interfaz accesible.

La presentación también advertía que el sistema podía dar respuestas plausibles e incorrectas. ELIZA nos había dejado una pregunta sobre la sensación de comprensión; ahora la fluidez podía acompañar capacidades mucho más amplias sin garantizar la verdad de cada respuesta. En 2023, el informe técnico de GPT-4 describió un modelo que aceptaba texto e imágenes y producía texto, y volvió a documentar errores factuales (OpenAI, 2023 (se abre en una pestaña nueva)).

Detrás de esa conversación hay dos etapas que conviene distinguir. Durante el entrenamiento se ajustan los parámetros del modelo; durante la inferencia, el modelo utiliza esos parámetros para producir una respuesta. La inferencia también ocurre cuando una red reconoce una imagen: es el momento de usar lo aprendido.

En 2025, nuevos lanzamientos de modelos de pesos abiertos ampliaron las opciones para probarlos por nuestra cuenta: sus parámetros entrenados podían descargarse para ejecutar, evaluar y adaptar el modelo (Qwen Team, 2025 (se abre en una pestaña nueva)).

Una laptop con globos de conversación junto a un libro abierto, papeles y una taza.

Leer, preguntar, volver a leer. Ilustración conceptual.

¿Qué cambia cuando una idea se vuelve utilizable?

Las evaluaciones que hemos visto nos dicen algo sobre los modelos. Pero, cuando necesitamos actuar a partir de una respuesta, la pregunta se vuelve más concreta. Imaginemos la conversación del principio aplicada a los documentos de una empresa. El asistente contesta con claridad, le pedimos un ejemplo y lo desarrolla. Hasta ahí, la experiencia sigue siendo cómoda. Pero en cuanto vamos a usar esa información para tomar una decisión, aparecen otras preguntas: ¿de qué documento salió?, ¿está actualizado?, ¿teníamos permiso para consultarlo?

Comprobar esas fuentes y permisos exige mirar más allá de la frase que aparece en pantalla. En el recorrido hemos ido distinguiendo piezas que aquí vuelven a encontrarse. La arquitectura describe cómo se organiza el cómputo; el modelo entrenado contiene valores numéricos ajustados durante el entrenamiento, como los pesos que vimos antes; y la aplicación reúne ese modelo con la información, las herramientas y las reglas necesarias para resolver el problema. En la pantalla recibimos una respuesta, pero su utilidad depende de cómo encajan todas esas decisiones.

Cómo leer el próximo anuncio

Es probable que el próximo anuncio llegue antes de que hayamos terminado de explorar los anteriores. Después de este recorrido, podemos recibirlo con curiosidad y preguntarnos dónde está el avance: en la arquitectura, los datos, la forma de entrenar, cómo se emplea el cómputo durante la inferencia o la interfaz que nos permite utilizarlo. La historia nos ha dado ejemplos de por qué cada una de esas piezas importa.

Las referencias permiten seguir desde ahí. ¿Qué tarea se evaluó y con qué se comparó el resultado? ¿Qué quedó fuera de la prueba? No hace falta leer todos los artículos de una vez: podemos empezar por el que nos haya despertado más curiosidad y contrastar lo que dice con lo que se está anunciando.

La próxima vez que una máquina te explique algo y le pidas que lo cuente de otra manera, la escena será parecida a la del principio. Ahora, sin embargo, detrás de esa respuesta podemos reconocer preguntas, experimentos y aportes de muchas personas a lo largo de décadas. La IA no acaba de nacer, y conocer su historia nos permite apreciar mejor lo que sigue cambiando.

Aun así, después de todo ese recorrido, la pregunta de Turing sigue esperando: ¿pueden pensar las máquinas? Saber cómo llegamos hasta aquí no la resuelve. Nos deja en una mejor posición para seguir conversando sobre ella.

Sobre esta revisión

Esta es una versión revisada de mi artículo de 2023 en LatinXinAI, publicado en Medium (se abre en una pestaña nueva). Conserva la pregunta que dio origen al texto, amplía el recorrido por las redes neuronales y los inviernos de la IA, contrasta los hitos con publicaciones originales y añade investigación posterior con fecha de corte en septiembre de 2025.

Notas

  1. Distintas decisiones bajo la misma metáfora. En el Reino Unido, el informe Lighthill fue parte de la revisión del apoyo a la IA. En Estados Unidos, la enmienda Mansfield de 1969 restringió el financiamiento militar de investigación a proyectos relacionados con funciones militares. Años después, DARPA cerró el programa de comprensión del habla SUR sin financiar su continuación. El National Research Council documenta esas trayectorias y también la continuidad de la investigación industrial; «invierno» no significa una suspensión mundial y simultánea (National Research Council, 1999, cap. 9 (se abre en una pestaña nueva)). Volver al recorrido.

  2. La retropropagación tiene antecedentes. Linnainmaa desarrolló el cálculo de derivadas en sentido inverso en el contexto de errores de redondeo; su artículo de 1976 remite a su tesis de 1970 (Linnainmaa, 1976 (se abre en una pestaña nueva)). La tesis de Werbos ya exponía en 1974 cómo calcular derivadas recorriendo relaciones funcionales en sentido inverso (Werbos, 1974, cap. II (se abre en una pestaña nueva)). Por eso aquí 1986 señala un hito para el aprendizaje de representaciones, no la invención de todo el procedimiento. Volver al recorrido.

Referencias

Acosta Pereira, P. O. (2023, 30 de agosto). AI: Is it really something new? A brief chronology. LatinXinAI, Medium. Artículo original (se abre en una pestaña nueva)

Bahdanau, D., Cho, K., & Bengio, Y. (2015). Neural machine translation by jointly learning to align and translate. 3rd International Conference on Learning Representations. ICLR 2015 (se abre en una pestaña nueva). Artículo de congreso (se abre en una pestaña nueva). Prepublicación de 2014 (se abre en una pestaña nueva)

Bengio, Y., Simard, P., & Frasconi, P. (1994). Learning long-term dependencies with gradient descent is difficult. IEEE Transactions on Neural Networks, 5(2), 157–166. https://doi.org/10.1109/72.279181 (se abre en una pestaña nueva)

Brown, T. B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., Agarwal, S., Herbert-Voss, A., Krueger, G., Henighan, T., Child, R., Ramesh, A., Ziegler, D. M., Wu, J., Winter, C., . . . Amodei, D. (2020). Language models are few-shot learners. En H. Larochelle, M. Ranzato, R. Hadsell, M. F. Balcan, & H. Lin (Eds.), Advances in Neural Information Processing Systems (Vol. 33, pp. 1877–1901). Curran Associates. Actas del congreso (se abre en una pestaña nueva). Prepublicación de 2020 (se abre en una pestaña nueva)

Campbell, M., Hoane, A. J., Jr., & Hsu, F.-h. (2002). Deep Blue. Artificial Intelligence, 134(1–2), 57–83. https://doi.org/10.1016/S0004-3702(01)00129-1 (se abre en una pestaña nueva)

Deng, J., Dong, W., Socher, R., Li, L.-J., Li, K., & Fei-Fei, L. (2009). ImageNet: A large-scale hierarchical image database. En 2009 IEEE Conference on Computer Vision and Pattern Recognition (pp. 248–255). IEEE. https://doi.org/10.1109/CVPR.2009.5206848 (se abre en una pestaña nueva)

Devlin, J., Chang, M.-W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of deep bidirectional transformers for language understanding. En J. Burstein, C. Doran, & T. Solorio (Eds.), Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers) (pp. 4171–4186). Association for Computational Linguistics. https://doi.org/10.18653/v1/N19-1423 (se abre en una pestaña nueva). Prepublicación de 2018 (se abre en una pestaña nueva)

Goodfellow, I., Bengio, Y., & Courville, A. (2016). Deep learning. MIT Press. Capítulo 1 (se abre en una pestaña nueva)

Hendler, J. (2008). Avoiding another AI winter. IEEE Intelligent Systems, 23(2), 2–4. https://doi.org/10.1109/MIS.2008.20 (se abre en una pestaña nueva)

Hinton, G. E., Osindero, S., & Teh, Y.-W. (2006). A fast learning algorithm for deep belief nets. Neural Computation, 18(7), 1527–1554. https://doi.org/10.1162/neco.2006.18.7.1527 (se abre en una pestaña nueva)

Hochreiter, S., & Schmidhuber, J. (1997). Long short-term memory. Neural Computation, 9(8), 1735–1780. https://doi.org/10.1162/neco.1997.9.8.1735 (se abre en una pestaña nueva)

Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E., de Las Casas, D., Hendricks, L. A., Welbl, J., Clark, A., Hennigan, T., Noland, E., Millican, K., van den Driessche, G., Damoc, B., Guy, A., Osindero, S., Simonyan, K., Elsen, E., . . . Sifre, L. (2022). An empirical analysis of compute-optimal large language model training. En S. Koyejo, S. Mohamed, A. Agarwal, D. Belgrave, K. Cho, & A. Oh (Eds.), Advances in Neural Information Processing Systems (Vol. 35, pp. 30016–30030). Curran Associates. Actas del congreso (se abre en una pestaña nueva)

Krizhevsky, A., Sutskever, I., & Hinton, G. E. (2012). ImageNet classification with deep convolutional neural networks. En F. Pereira, C. J. C. Burges, L. Bottou, & K. Q. Weinberger (Eds.), Advances in Neural Information Processing Systems (Vol. 25, pp. 1097–1105). Curran Associates. Actas del congreso (se abre en una pestaña nueva)

Lighthill, J. (1973). Artificial intelligence: A general survey. En Artificial intelligence: A paper symposium. Science Research Council. Informe y respuestas (se abre en una pestaña nueva)

Linnainmaa, S. (1976). Taylor expansion of the accumulated rounding error. BIT Numerical Mathematics, 16, 146–160. https://doi.org/10.1007/BF01931367 (se abre en una pestaña nueva). (Remite a su tesis de 1970).

McCarthy, J., Minsky, M. L., Rochester, N., & Shannon, C. E. (1955, 31 de agosto). A proposal for the Dartmouth summer research project on artificial intelligence. Propuesta original (se abre en una pestaña nueva)

McCulloch, W. S., & Pitts, W. (1943). A logical calculus of the ideas immanent in nervous activity. Bulletin of Mathematical Biophysics, 5, 115–133. https://doi.org/10.1007/BF02478259 (se abre en una pestaña nueva)

McDermott, J. (1982). R1: A rule-based configurer of computer systems. Artificial Intelligence, 19(1), 39–88. https://doi.org/10.1016/0004-3702(82)90021-2 (se abre en una pestaña nueva)

Minsky, M., & Papert, S. A. (1969). Perceptrons: An introduction to computational geometry. MIT Press. Edición original (se abre en una pestaña nueva)

National Research Council. (1999). Funding a revolution: Government support for computing research. National Academies Press. https://doi.org/10.17226/6323 (se abre en una pestaña nueva). Capítulo 9 (se abre en una pestaña nueva)

Olazaran, M. (1996). A sociological study of the official history of the perceptrons controversy. Social Studies of Science, 26(3), 611–659. https://doi.org/10.1177/030631296026003005 (se abre en una pestaña nueva)

OpenAI. (2022, 30 de noviembre). Introducing ChatGPT. Anuncio de presentación (se abre en una pestaña nueva)

OpenAI. (2023). GPT-4 technical report (Versión 1) [Prepublicación]. arXiv. arXiv:2303.08774v1 (se abre en una pestaña nueva)

Ouyang, L., Wu, J., Jiang, X., Almeida, D., Wainwright, C. L., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., Schulman, J., Hilton, J., Kelton, F., Miller, L., Simens, M., Askell, A., Welinder, P., Christiano, P. F., Leike, J., & Lowe, R. (2022). Training language models to follow instructions with human feedback. En S. Koyejo, S. Mohamed, A. Agarwal, D. Belgrave, K. Cho, & A. Oh (Eds.), Advances in Neural Information Processing Systems (Vol. 35, pp. 27730–27744). Curran Associates. Actas del congreso (se abre en una pestaña nueva)

Qwen Team. (2025, 29 de abril). Qwen3: Think deeper, act faster. Anuncio de lanzamiento (se abre en una pestaña nueva)

Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., & Sutskever, I. (2019). Language models are unsupervised multitask learners [Informe técnico]. OpenAI. Informe original (se abre en una pestaña nueva)

Rosenblatt, F. (1958). The perceptron: A probabilistic model for information storage and organization in the brain. Psychological Review, 65(6), 386–408. https://doi.org/10.1037/h0042519 (se abre en una pestaña nueva)

Rumelhart, D. E., Hinton, G. E., & Williams, R. J. (1986). Learning representations by back-propagating errors. Nature, 323, 533–536. https://doi.org/10.1038/323533a0 (se abre en una pestaña nueva)

Silver, D., Huang, A., Maddison, C. J., Guez, A., Sifre, L., van den Driessche, G., Schrittwieser, J., Antonoglou, I., Panneershelvam, V., Lanctot, M., Dieleman, S., Grewe, D., Nham, J., Kalchbrenner, N., Sutskever, I., Lillicrap, T., Leach, M., Kavukcuoglu, K., Graepel, T., & Hassabis, D. (2016). Mastering the game of Go with deep neural networks and tree search. Nature, 529, 484–489. https://doi.org/10.1038/nature16961 (se abre en una pestaña nueva)

Sutskever, I., Vinyals, O., & Le, Q. V. (2014). Sequence to sequence learning with neural networks. En Z. Ghahramani, M. Welling, C. Cortes, N. Lawrence, & K. Weinberger (Eds.), Advances in Neural Information Processing Systems (Vol. 27). Curran Associates. Actas del congreso (se abre en una pestaña nueva)

Turing, A. M. (1950). Computing machinery and intelligence. Mind, 59(236), 433–460. https://doi.org/10.1093/mind/LIX.236.433 (se abre en una pestaña nueva)

Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention is all you need. En I. Guyon, U. von Luxburg, S. Bengio, H. Wallach, R. Fergus, S. V. N. Vishwanathan, & R. Garnett (Eds.), Advances in Neural Information Processing Systems (Vol. 30). Curran Associates. Actas del congreso (se abre en una pestaña nueva). Prepublicación de 2017 (se abre en una pestaña nueva)

Weizenbaum, J. (1966). ELIZA—a computer program for the study of natural language communication between man and machine. Communications of the ACM, 9(1), 36–45. https://doi.org/10.1145/365153.365168 (se abre en una pestaña nueva)

Werbos, P. J. (1974). Beyond regression: New tools for prediction and analysis in the behavioral sciences [Tesis doctoral, Harvard University]. Texto original (se abre en una pestaña nueva)

¿Qué quieres explorar?

↑ ↓ para moverte · Enter para abrir · Esc para cerrar

Nota

Leer en las notas