Los grandes modelos de lenguaje también pueden aprender conceptos al final, pero con la condición de que primero agoten todas las demás opciones; esto contrasta de forma marcada con la manera en que los seres humanos abstraen directamente conceptos a partir de muy pocos datos.
En este episodio de AI on Air, hemos seleccionado clips recientes del programa de Redpoint; el presentador es Lukasz Kaiser, coautor del paper sobre Transformers, ex investigador de Google Brain y de OpenAI. Desde la perspectiva de quien lo ha vivido en primera persona, desglosa la brecha esencial entre los Transformers y el aprendizaje humano.
▷ Tras combinar razonamiento en cadena, aprendizaje por refuerzo y herramientas, este modelo de «predecir la siguiente palabra» ya es capaz de hacer cosas que, hace dos años, resultaban difíciles de imaginar: por ejemplo, dedicar varias horas al día a debatir problemas laborales con un asistente de programación y llevarlo a una implementación real.
▷ Lo compara así: los LLM primero se «tragan» billones de tokens, aprenden todos los patrones superficiales y solo cuando todo eso no logra explicarlo es cuando capturan los conceptos; en cambio, los humanos a menudo obtienen e incluso crean conceptos directamente a partir de pocos datos.
▷ Ambas partes están evolucionando: los Transformers siguen mejorando, pero los argumentos de que «se necesita algo más» también son cada vez más sólidos. Ya hay laboratorios que exploran la arquitectura de Transformers y observan resultados interesantes; en cuanto a quién ganará, todavía es una incógnita.🪁
En este episodio de AI on Air, hemos seleccionado clips recientes del programa de Redpoint; el presentador es Lukasz Kaiser, coautor del paper sobre Transformers, ex investigador de Google Brain y de OpenAI. Desde la perspectiva de quien lo ha vivido en primera persona, desglosa la brecha esencial entre los Transformers y el aprendizaje humano.
▷ Tras combinar razonamiento en cadena, aprendizaje por refuerzo y herramientas, este modelo de «predecir la siguiente palabra» ya es capaz de hacer cosas que, hace dos años, resultaban difíciles de imaginar: por ejemplo, dedicar varias horas al día a debatir problemas laborales con un asistente de programación y llevarlo a una implementación real.
▷ Lo compara así: los LLM primero se «tragan» billones de tokens, aprenden todos los patrones superficiales y solo cuando todo eso no logra explicarlo es cuando capturan los conceptos; en cambio, los humanos a menudo obtienen e incluso crean conceptos directamente a partir de pocos datos.
▷ Ambas partes están evolucionando: los Transformers siguen mejorando, pero los argumentos de que «se necesita algo más» también son cada vez más sólidos. Ya hay laboratorios que exploran la arquitectura de Transformers y observan resultados interesantes; en cuanto a quién ganará, todavía es una incógnita.🪁
