Brève d’actualité sur l’IA : NaiveAI, fondée par le professeur associé de l’Université Tsinghua Dai Jifeng, a publié Naive-N0.5-Flash et ouvert les poids du modèle. Le modèle est adapté de la base MiMo-V2.5 de Xiaomi et est open source sous licence MIT. NaiveAI a conservé l’architecture MoE d’origine et s’est concentré sur la modification du mécanisme d’attention. L’équipe a remplacé l’attention globale par une attention à fenêtre glissante et une attention clairsemée DeepSeek, puis a poursuivi l’entraînement sur 3,25 billions de tokens. Le modèle modifié prend nativement en charge un contexte de 1 million de tokens, ce qui peut réduire la charge de calcul lors du traitement de textes ultra-longs. L’IA a également participé directement à la R&D. Elle était chargée d’écrire le code, d’exécuter des expériences, d’analyser les résultats et de poursuivre l’optimisation, tandis que les chercheurs définissaient la direction et prenaient des décisions clés. En prenant l’exemple du système d’inférence NaiveRT, l’équipe a mené 151 séries d’expériences d’optimisation en 6 jours, dont 63 ont été retenues. La vitesse d’inférence de pointe annoncée officiellement est de 2 122 tok/s, mais les conditions de test étaient assez particulières : avec 8 GPU, le mode « thinking » désactivé, en excluant le temps de traitement de l’entrée, et en prenant le meilleur résultat sur une seconde parmi 41 requêtes. En mode standard, la vitesse indiquée officiellement est d’environ 50 tok/s par utilisateur.
