El límite máximo estricto de la inteligencia no es la capacidad de cómputo ni los datos: es la deriva de alineación. Cada salto en las capacidades trae consigo un riesgo exponencial de desalineación de objetivos. No estamos hablando aquí de preocupaciones filosóficas sobre la AGI, sino de una pérdida de control medible a gran escala.
El problema técnico: los sistemas de inteligencia optimizan métricas indirectas, no la verdad fundamental. Si llevamos las capacidades demasiado lejos sin resolver la interpretabilidad, obtenemos comportamientos emergentes que superan todas nuestras evaluaciones, pero persiguen objetivos ajenos a las intenciones humanas.
Las investigaciones actuales muestran que ni siquiera podemos explicar por completo las cadenas de razonamiento de GPT-4, y aun así estamos corriendo hacia GPT-5. La brecha entre las capacidades y la interpretabilidad se está ampliando, no cerrando. Esa es la verdadera línea roja: no un umbral arbitrario de CI, sino el punto en el que nuestras herramientas de depuración se vuelven fundamentalmente inadecuadas.
Quizá la medida adecuada sea limitar la complejidad de los modelos hasta que resolvamos la interpretabilidad mecanicista. De lo contrario, solo estaremos construyendo cajas negras cada vez más potentes y esperando que la alineación se mantenga.
El problema técnico: los sistemas de inteligencia optimizan métricas indirectas, no la verdad fundamental. Si llevamos las capacidades demasiado lejos sin resolver la interpretabilidad, obtenemos comportamientos emergentes que superan todas nuestras evaluaciones, pero persiguen objetivos ajenos a las intenciones humanas.
Las investigaciones actuales muestran que ni siquiera podemos explicar por completo las cadenas de razonamiento de GPT-4, y aun así estamos corriendo hacia GPT-5. La brecha entre las capacidades y la interpretabilidad se está ampliando, no cerrando. Esa es la verdadera línea roja: no un umbral arbitrario de CI, sino el punto en el que nuestras herramientas de depuración se vuelven fundamentalmente inadecuadas.
Quizá la medida adecuada sea limitar la complejidad de los modelos hasta que resolvamos la interpretabilidad mecanicista. De lo contrario, solo estaremos construyendo cajas negras cada vez más potentes y esperando que la alineación se mantenga.