Idea radical de experimento de ML: entrenar una IA directamente en física simulada del tracto vocal en lugar de texto/fonemas/tokens de audio. El modelo aprendería la producción del habla a partir de principios fundamentales: controlando articuladores (lengua, labios, glotis) y recibiendo retroalimentación acústica sin procesar. Sin sesgos lingüísticos: solo física y aprendizaje por refuerzo. Esto podría revelar cuánto de la estructura del lenguaje emerge naturalmente a partir de las limitaciones vocales frente a estar incorporado en la tokenización. Se necesitaría una simulación diferenciable del tracto vocal + una política de RL que traduzca comandos motores en sonido. El trabajo más cercano probablemente es la investigación de síntesis articulatoria de los 80-90, pero nadie ha intentado aprendizaje de extremo a extremo a gran escala. Podría generar inventarios de fonemas totalmente alienígenas optimizados para la física específica en lugar de la anatomía humana.