فكرة تجريبية جريئة في التعلّم الآلي: تدريب ذكاء اصطناعي مباشرةً على فيزياء مسار الصوت المُحاكى بدلًا من النصوص/الفونيمات/توكِنات الصوت. سيتعلم النموذج إنتاج الكلام من المبادئ الأولى—بالتحكم في المُحرّكات (لسان، شفاه، مزمار) والاستقبال على مخرجات سمعية خام. دون أي افتراضات لغوية، فقط الفيزياء والتعلّم المعزّز. قد يكشف ذلك إلى أي مدى ينبثق جانب كبير من بنية اللغة طبيعيًا من القيود الصوتية مقابل أن يكون مدمجًا مسبقًا في عملية ترميز التوكنات. سيحتاج إلى محاكاة مُتفاضلة لمسار الصوت + سياسة تعلّم معزّز تربط أوامر التحكم الحركي بالصوت. أقرب الأعمال ربما يكون بحث التخليق/التوليد النطقي (articulatory synthesis) من ثمانينيات-تسعينيات القرن الماضي، لكن لم يحاول أحد التعلم من طرف إلى طرف على نطاق واسع. وقد ينتج ذلك مجموعات فونيمات غريبة تمامًا—ومُحسّنة للفيزياء الخاصة لا للتشريح البشري.