Contrairement aux méthodes de saisie classiques, ce produit fait passer l’assistance à l’expression en amont de l’étape de saisie. Par défaut, la touche Fn déclenche l’insertion vocale. Vous pouvez soit parler brièvement, soit parler en maintenant la touche enfoncée. Une seconde activation de Fn ou un double-clic permet d’envoyer des instructions IA, telles que « rédiger un rapport hebdomadaire » ou « générer des invites pour le développement ».

Auteur de l’article, source : AIBase


Positionnement produit et situation du test interne

Récemment, Tencent teste en interne, de façon discrète, un outil natif d’audio/« expression » par IA : ChatterFly. Certaines sources indiquent que son nom chinois serait « Yuanbao » ou qu’il s’appellerait « Yuanbao input method ». À l’heure actuelle, des clients desktop pour macOS et Windows sont disponibles. Un code de test interne est requis ; iOS et Android sont indiqués comme « bientôt disponible ».

Innovations des fonctionnalités clés

Contrairement aux méthodes de saisie classiques qui se limitent à « convertir la voix en texte », ChatterFly fait passer l’assistance à l’expression en amont de l’étape de saisie : par défaut, la touche Fn déclenche la saisie vocale, avec un appui bref ou en maintenant la touche enfoncée ; une nouvelle activation de Fn ou un double-clic permet d’envoyer des instructions IA, telles que « rédiger un rapport hebdomadaire » ou « générer des invites pour le développement ». La page d’accueil intègre le récapitulatif des saisies, le dictionnaire personnel, l’historique vocal, Skills et les paramètres. En haut, elle affiche des données comportementales telles que le nombre total de caractères, la part de la voix, la vitesse de la voix et le temps économisé.

Performances du module Skills et résultats observés

Le module Skills est un module central. Dans la première phase, il intègre des capacités telles que des comptes rendus de réunions, des rapports de travail, la planification de projets, la rédaction de contenus marketing, le polissage d’e-mails et l’optimisation des invites de VibeCoding. Activez-les via les interrupteurs et réécrivez en fonction du contexte. En tests, la narration à voix haute pour organiser un dîner peut automatiquement répartir les créneaux, le lieu, le transport et les actions suivantes ; la narration « faire une application de reconnaissance d’insectes » peut produire la structure des pages, les limites des données et les critères d’acceptation, puis être directement transmise à l’agent de développement. Le dictionnaire personnel prend en charge la mémorisation automatique après modification par la voix ; il permet aussi d’ajouter manuellement des noms propres. Il prend en charge la migration en un clic du dictionnaire via une autorisation, vers le dictionnaire Sogou. Toutefois, les mots contenant des chiffres et des symboles peuvent ne pas fonctionner dans un contexte de saisie en pinyin.

Contexte technique et points de vue de l’industrie

D’après des informations officielles, le produit est conçu pour s’adapter aux réseaux faibles, aux environnements bruyants et aux environnements à voix basse, en s’appuyant sur les capacités de grands modèles tels que Hunyuan pour capitaliser sur les habitudes des utilisateurs. Dans l’industrie, on estime qu’il prolonge, après Tencent Sogou et l’application de saisie WeChat, la branche « expression par IA » ; mais pendant la phase de test interne, la qualité de génération, la précision des termes professionnels et le contrôle des hallucinations restent à confirmer par la version officielle.