A principios de 2019, OpenAI , una startup cofundada por Elon Musk dedicada a garantizar que la inteligencia general artificial sea segura para la humanidad, anunció que había creado una red neuronal para el procesamiento del lenguaje natural llamada GPT-2. En lo que algunos vieron como un truco publicitario y otros como un signo de un inminente apocalipsis de robots, OpenAI inicialmente eligió no lanzar públicamente el generador de texto. Debido a que la herramienta podía producir texto lo suficientemente realista como para que, en algunos casos, fuera difícil de distinguir de la escritura humana , sus creadores temían que GPT-2 pudiera ser apropiado como una manera fácil para que los malos actores produjeran muchas noticias falsas o propaganda.
Ciertamente, las noticias falsas se han convertido en un problema generalizado e insidioso, y en un año en el que estamos lidiando tanto con una pandemia global como con la posible reelección de Donald Trump como presidente de los Estados Unidos, parece un texto más poderoso y realista. La IA es una de las últimas cosas que necesitamos en este momento.
Sin embargo, a pesar de los riesgos potenciales, OpenAI anunció a fines del mes pasado que el sucesor de GPT-2 está completo. Se llama, lo has adivinado, GPT-3.
Un artículo publicado por investigadores de OpenAI en el servidor de preimpresión arXiv describe GPT-3 como un modelo de lenguaje autorregresivo con 175 mil millones de parámetros. 175 mil millones es mucho ; En aras de la comparación, la versión final de GPT-2 , lanzada en noviembre de 2019, tenía 1.500 millones de parámetros. El modelo de generación de lenguaje natural Turing de Microsoft, lanzado para una demostración privada en febrero, tenía 17 mil millones de parámetros.
"Parámetro" se refiere a un atributo que un modelo de aprendizaje automático define en función de sus datos de entrenamiento. Entonces, ¿cómo pasó OpenAI de 1.5 billones de estos a 175 billones? Al contrario de lo que podría adivinar basado en el tamaño masivo de GPT-3, la tecnología detrás de esto no es más avanzada que la de herramientas similares, y no contiene nuevos métodos de formación o arquitecturas; sus creadores simplemente aumentaron la cantidad de datos de entrada en un orden de magnitud.
Los datos provienen de Common Crawl , una organización sin fines de lucro que escanea la web abierta todos los meses y descarga contenido de miles de millones de páginas HTML y luego la pone a disposición en un formato especial para la minería de datos a gran escala. En 2017, el "rastreo" mensual promedio arrojó más de tres mil millones de páginas web. Common Crawl ha estado haciendo esto desde 2011, y tiene petabytes de datos en más de 40 idiomas diferentes. El equipo de OpenAI aplicó algunas técnicas de filtrado para mejorar la calidad general de los datos, incluida la adición de conjuntos de datos seleccionados como Wikipedia.
GPT son las siglas en inglés de Transformador preformado generativo. La parte "transformador" se refiere a una arquitectura de red neuronal introducida por Google en 2017 . En lugar de mirar las palabras en orden secuencial y tomar decisiones basadas en el posicionamiento de una palabra dentro de una oración, los generadores de texto o discurso con este diseño modelan las relaciones entre todas las palabras en una oración a la vez. Cada palabra obtiene un "puntaje de atención", que se utiliza como su peso y se alimenta a la red más grande. Esencialmente, esta es una forma compleja de decir que el modelo está sopesando la probabilidad de que una palabra dada sea precedida o seguida por otra palabra, y cuánto cambia esa probabilidad en función de las otras palabras en la oración.
Al encontrar las relaciones y patrones entre las palabras en un conjunto de datos gigante, el algoritmo finalmente termina aprendiendo de sus propias inferencias, en lo que se llama aprendizaje automático no supervisado. Y no termina con palabras: GPT-3 también puede descubrir cómo se relacionan los conceptos entre sí y discernir el contexto.
En el documento, el equipo de OpenAI señala que GPT-3 se desempeñó bien cuando se le asignó la tarea de traducir, responder preguntas y hacer ejercicios de comprensión de lectura que requerían completar los espacios en blanco donde se habían eliminado las palabras. También dicen que el modelo fue capaz de hacer "razonamientos sobre la marcha", y que generó artículos de noticias de muestra de 200 a 500 palabras que eran difíciles de distinguir de los escritos por personas.
Los autores reconocen que GPT-3 podría ser mal utilizado de varias maneras, incluso para generar información errónea y spam, phishing, abuso de procesos legales y gubernamentales, e incluso ensayos académicos falsos. Más de unos pocos estudiantes de último año de secundaria seguramente aprovecharían la oportunidad de que una IA escriba su ensayo de admisión a la universidad (pero entre los posibles usos indebidos de esta herramienta, esa es la menor de nuestras preocupaciones).
A principios de este año, un editor de The Economist le dio a GPT-2 una lista de preguntas sobre lo que 2020 tenía en la tienda . El algoritmo predijo la turbulencia económica, "cambios importantes en China" y ninguna reelección para Donald Trump, entre otras cosas. Es un poco aterrador imaginar lo que GPT-3 podría predecir para 2021 una vez que hayamos ingresado todos los artículos de 2020, que está resultando ser un año histórico de una manera bastante terrible.
Por ahora, sin embargo, nadie fuera de OpenAI tiene acceso a GPT-3; la compañía no ha publicado ningún detalle de cuándo, cómo o si el algoritmo se lanzará al público. Podría suceder en fases, similar a GPT-2. Pero el gran tamaño de la nueva versión presenta complicaciones adicionales; Según Joe Davison, un ingeniero de investigación en una startup que también está trabajando en el procesamiento del lenguaje natural, "los recursos computacionales necesarios para usar GPT-3 en el mundo real lo hacen extremadamente poco práctico".
Mientras tanto, sin embargo, OpenAI tiene una supercomputadora recientemente creada a medida por Microsoft para la investigación de aprendizaje automático. Esto hará que sea más fácil mejorar rápidamente las habilidades de GPT-3, y tal vez incluso comenzar a trabajar en la próxima iteración del modelo en un futuro no muy lejano.
¿Qué tan poderosos pueden ser estos algoritmos de procesamiento de lenguaje natural? Quizás sea simultáneamente un consuelo y un déficit pensar que, incluso después de haber sido alimentado con el valor de años de todo el conjunto de conocimientos de Internet, ningún modelo podría haber predicho lo que traería 2020, pero, de nuevo, ningún ser humano podría haberlo hecho.
Crédito de imagen: Willi Heidelbach de Pixabay