Message d’IA de ME. Lors de la conférence de septembre d’Apple, un détail plutôt discret a été révélé dans les notes de bas de page : des fonctions reposant sur des modèles côté serveur, comme Siri AI, disposent d’une limite d’utilisation quotidienne. À l’avenir, des plafonds plus élevés « seront fournis sous forme payante ». Les fonctionnalités traitées directement sur l’appareil ne comptent pas dans cette limite. Les quotas des fonctions côté service varient selon la fonction, la complexité des requêtes, la charge du système et les politiques de ce dernier ; une fois le plafond atteint, la fonction sera suspendue pendant un certain temps. Apple précise aussi que les abonnements iCloud+ des niveaux supérieurs incluront un accès élargi à ces fonctions limitées.     En apparence, cette note ressemble à un sujet de tarification ; en réalité, c’est un problème de coûts. Dès qu’une requête est acheminée vers le cloud, chaque inférence coûte concrètement en puissance de calcul. Or la couche où ces ressources sont consommées dépend de l’architecture. Par conséquent, la controverse autour du modèle commercial de l’IA personnelle doit d’abord être abordée sous l’angle d’une architecture hybride « terminal—bord—cloud ».   Dans une architecture hybride « terminal—bord—cloud », la structure des coûts marginaux diffère entièrement selon les couches. Côté terminal, les coûts sont presque totalement anticipés : après un investissement matériel unique, le coût marginal des inférences locales tend vers zéro. Côté bord (la « nouvelle espèce » inventée par Lenovo — l’AI PC), les coûts correspondent à la facture d’électricité et à l’amortissement du matériel, et n’augmentent pas de façon linéaire avec le nombre d’appels. Seul le côté cloud est facturé en fonction du volume d’appels : les coûts y sont fortement corrélés à l’usage.   Cela signifie que le fait d’effectuer la même tâche d’IA dans une couche ou dans une autre change totalement le résultat commercial. L’architecture détermine la courbe des coûts ; la courbe des coûts détermine l’espace de tarification disponible : c’est le point de départ pour comprendre le modèle commercial de l’IA personnelle.   Les deux couches « terminal—cloud » d’Apple : pourquoi la pression des coûts se concentre côté cloud   Apple adopte une architecture en deux couches : « terminal—cloud ». L’appareil prend en charge les tâches quotidiennes, exigeant une faible latence et une forte confidentialité ; les requêtes plus complexes sont alors routées vers le serveur. Le problème est qu’il n’y a pas de couche intermédiaire capable de répartir la charge : plus il y a de requêtes, plus on envoie de trafic dans le système de facturation du cloud.   D’où le caractère inévitable, sur le plan commercial, du duo « limite quotidienne + extension payante » : l’abonnement sert d’entrée, et la facturation par tokens en constitue le cœur. Au niveau le plus élevé d’Apple One (Premier), le prix atteint 39,95 $ par mois sur le marché américain ; l’offre inclut les fonctions de base de Siri AI. Au-delà de la limite quotidienne, un paiement supplémentaire est requis. Il s’agit à la fois d’une tarification plus fine et d’un transfert vers les utilisateurs intensifs du coût de la puissance de calcul côté cloud.   Le modèle d’abonnement en lui-même n’a rien de faux : il a été maintes fois validé à l’ère du SaaS. Spotify, Netflix, Adobe et Microsoft 365 ont tous prouvé que cette voie fonctionne. Mais les services d’IA présentent une différence clé avec le SaaS traditionnel : dans ce dernier, les coûts proviennent principalement des serveurs, des licences et de l’exploitation, et la tarification dépend peu du volume d’usage. Pour l’IA, au contraire, les coûts sont presque entièrement constitués de la puissance de calcul nécessaire aux inférences ; la tarification est donc fortement liée au volume d’usage. Essayer de couvrir, avec un prix fixe, un produit dont l’élasticité d’usage est très élevée crée inévitablement deux plafonds : pour les utilisateurs légers, cela ne vaut pas le prix ; pour les utilisateurs lourds, c’est trop cher. Et quand ces deux plafonds apparaissent en même temps, la cause profonde reste l’architecture : lorsque les coûts sont rigides et concentrés côté cloud, il devient difficile de satisfaire simultanément les deux extrémités avec une tarification unique.   Architecture en trois couches « terminal—bord—cloud » : absorber les coûts avant l’entrée de facturation   La valeur commerciale d’une architecture « terminal—bord—cloud » réside précisément dans l’absorption des coûts avant l’entrée de facturation. D’après les informations divulguées par Lenovo, Tianxi AI vise à faire en sorte qu’environ 80 % des tâches soient réalisées côté terminal et côté bord — ces appels ne génèrent pas de facture cloud ; seules les parties qui nécessitent vraiment la puissance de calcul du cloud sont facturées par tokens. Ainsi, pour un même million de tokens appelés, la part qui doit réellement être payée au tarif cloud ne représente plus qu’environ 20 %.   Parmi les couches, la couche « bord » est la plus facile à sous-estimer. L’AI PC déploie directement des modèles open source dans le foyer et l’entreprise, ainsi que dans les magasins et les usines : la faible latence permet de répondre aux besoins de contrôle temps réel en usine ; la localisation satisfait les exigences de conformité selon lesquelles les données ne doivent pas quitter les lieux ; l’inférence hors ligne comble aussi les scénarios en faible connectivité. Selon des informations publiques, l’AI PC peut réduire les coûts en tokens de plus de 80 % par rapport à un système purement cloud. Pour des cas à forte fréquence comme l’inspection qualité en usine ou le service client en magasin, « économiser des tokens côté bord » n’est pas un slogan : c’est une ligne vérifiable directement sur le tableau mensuel des coûts.     Une fois la structure de coûts mieux maîtrisée, l’espace de combinaison des modèles économiques s’ouvre aussi. Un chemin typique consiste à « utiliser l’abonnement comme enveloppe, et les quotas de tokens comme cœur » : livrer une puissance de calcul standardisée via un abonnement mensuel, puis la segmenter par paliers de quotas afin d’aligner davantage paiement et usage ; et, en complément, fournir des clés physiques et un centre de routage pour résoudre les enjeux de sécurité, de partage et d’orchestration de l’IA en entreprise.   Cette combinaison n’a pas qu’un sens « économique ». Pour les clients entreprises, des coûts prévisibles signifient que l’IA peut être intégrée au budget annuel : on passe d’un mode « projets » à une « capacité permanente ». Pour les fabricants, laisser 80 % de la puissance de calcul sur le terminal et le bord implique une forte compression du coût marginal côté cloud : les marges brutes ne se dégradent plus avec l’augmentation du volume d’appels. C’est l’une des clés vitales des services d’IA basés sur l’abonnement. De plus, dans des secteurs comme la finance, la santé ou l’administration, où les données ne peuvent pas être envoyées dans le cloud, l’inférence localisée est elle-même une capacité de conformité valorisable, et pas seulement une ligne de coûts.   En mettant les deux trajectoires côte à côte, la différence est structurelle : dans une architecture à deux couches « terminal—cloud », concentrer davantage de requêtes vers le cloud entraîne une pression de coûts du type « plus on utilise, plus on perd vite » ; c’est là la vraie raison de l’apparition de « la limite quotidienne ». Ce n’est pas un outil marketing, mais une conséquence inévitable liée à l’architecture. Dans une architecture à trois couches « terminal—bord—cloud », la majorité des coûts est absorbée avant même l’entrée de facturation. En d’autres termes, dans l’architecture à deux couches, une tarification fine n’est qu’un correctif ; dans l’architecture à trois couches, l’architecture elle-même constitue la solution.   Ce qui compose l’écart de coûts : prix côté offre et choix d’architecture   L’écart de coût unitaire provient à moitié du côté de l’offre, et à moitié du côté des choix d’architecture. Côté offre : la popularisation des modèles open source (DeepSeek, Tongyi, etc.) et la diversification des puces d’inférence font tomber le prix des tokens côté cloud vers l’ordre de grandeur de 0,5 yuan pour 1 million de tokens. Côté architecture : l’architecture à deux couches « terminal—cloud » fait entrer davantage de requêtes dans le système de facturation cloud ; l’architecture à trois couches « terminal—bord—cloud » commence par absorber la majeure partie des requêtes localement. La combinaison de ces deux facteurs produit un écart de coûts à l’échelle de plusieurs ordres de grandeur.   Cela explique aussi la logique de chaque trajectoire. Pour les fabricants principalement orientés « terminal—cloud », la continuité du modèle d’abonnement ne tient pas seulement aux habitudes des utilisateurs : c’est aussi le chemin le plus court pour générer des revenus de service au sein de leur propre écosystème. Pour les fabricants principalement orientés « terminal—bord—cloud », la tarification par tokens permet pour la première fois de faire tenir une structure de coûts d’IA de manière précise pour les entreprises, et de la rendre lisible par les autorités de régulation.   Du point de vue de l’industrie, l’hybride terminal-cloud change aussi l’unité de mesure de la concurrence. Autrefois, on comparait « la puissance des modèles » ; aujourd’hui, on compare « le coût global de chaque tâche » — ce qui inclut à la fois le prix unitaire des tokens, et la couche vers laquelle la requête est routée, ainsi que qui supporte la puissance de calcul. Lorsque les coûts peuvent être calculés précisément, les décisions d’achat changent aussi : les entreprises ne regardent plus uniquement les classements des modèles, mais le coût d’atterrissage (déploiement) par tâche. Certaines entreprises ont déjà transformé cette logique en produit : livraison de puissance de calcul « prête à l’emploi », usage transparent et traçable, et sélection automatique du modèle selon les caractéristiques de la tâche.   La concurrence commerciale de l’IA personnelle, en surface, semble être une bataille de modes de facturation ; en réalité, c’est une bataille : « à quelle couche restent les coûts ». La nature commerciale du schéma hybride terminal-cloud consiste à laisser les coûts dans la couche la plus proche de l’utilisateur, où le coût marginal est le plus faible, tout en réservant la tarification à la couche la plus facilement acceptable par l’utilisateur.   Pour l’industrie, il existe un jugement : qui parviendra le plus tôt à concrétiser la commercialisation de la couche « bord » aura davantage de chances de transformer l’IA personnelle en une activité durable, dans un cadre où les coûts restent contrôlables. Au cours de la prochaine décennie, la bataille de l’IA personnelle ne portera pas seulement sur la capacité des modèles, mais aussi sur qui dispose du meilleur « carnet de comptes » de puissance de calcul. (Source : ME)