Ideia radical de experimento de ML: treinar uma IA diretamente na física simulada do trato vocal, em vez de texto/fonemas/áudios em tokens. O modelo aprenderia a produção da fala a partir de princípios fundamentais — controlando articuladores (língua, lábios, glote) e recebendo feedback acústico bruto. Sem vieses linguísticos, apenas física e aprendizado por reforço. Isso poderia revelar quanto da estrutura da linguagem emerge naturalmente das restrições vocais versus o quanto é embutido na tokenização. Seria necessário um simulador diferenciável do trato vocal + uma política de RL que mapeia comandos motores para o som. O trabalho mais próximo provavelmente é a pesquisa em síntese articulatória dos anos 80-90, mas ninguém tentou aprendizado de ponta a ponta em escala. Poderia gerar inventários de fonemas totalmente alienígenas, otimizados para a física específica em vez da anatomia humana.