Ce soir, en tête du classement de chaleur des vidéos avec des visages, 58 voix pour l’article « ROWBench » : la question est de savoir si les modèles vidéo savent vraiment générer des images en respectant strictement les normes de code.
Ils ont fourni un ensemble d’instructions de rendu procédural, afin que des modèles vidéo grand public produisent les images correspondantes selon un script, et l’écart est clairement visible à l’œil nu. Le plus performant arrive à respecter de façon stable plus de 80 % des spécifications de plans, tandis que le plus faible n’arrive même pas à faire fonctionner les contraintes de base du programme.
Le lien avec le monde des cryptos, c’est que sur la piste des « agents IA », le principal risque est « sortir selon les instructions, mais ne pas pouvoir les expliquer clairement ». Le règlement des protocoles d’agent on-chain, l’alimentation des prix par les oracles, l’exécution des ponts inter-chaînes : tout tourne autour d’un programme prédéfini. Si on n’arrive pas à franchir cette étape des modèles vidéo, alors la base d’ingénierie nécessaire à la coordination massive d’agents on-chain devra encore être polie pendant deux à trois ans.
Mais à l’inverse, on peut aussi penser que les équipes d’ingénierie capables de résoudre l’uniformité des standards de programmation sont très probablement aussi la direction des prochaines infrastructures « tueuses » de protocoles d’agents. $FET $TAO Sur cette ligne, la barrière défensive au niveau de l’ingénierie est plus importante que l’itération pure du modèle.
#视频模型评测 #程序规范一致性 #AI
Ils ont fourni un ensemble d’instructions de rendu procédural, afin que des modèles vidéo grand public produisent les images correspondantes selon un script, et l’écart est clairement visible à l’œil nu. Le plus performant arrive à respecter de façon stable plus de 80 % des spécifications de plans, tandis que le plus faible n’arrive même pas à faire fonctionner les contraintes de base du programme.
Le lien avec le monde des cryptos, c’est que sur la piste des « agents IA », le principal risque est « sortir selon les instructions, mais ne pas pouvoir les expliquer clairement ». Le règlement des protocoles d’agent on-chain, l’alimentation des prix par les oracles, l’exécution des ponts inter-chaînes : tout tourne autour d’un programme prédéfini. Si on n’arrive pas à franchir cette étape des modèles vidéo, alors la base d’ingénierie nécessaire à la coordination massive d’agents on-chain devra encore être polie pendant deux à trois ans.
Mais à l’inverse, on peut aussi penser que les équipes d’ingénierie capables de résoudre l’uniformité des standards de programmation sont très probablement aussi la direction des prochaines infrastructures « tueuses » de protocoles d’agents. $FET $TAO Sur cette ligne, la barrière défensive au niveau de l’ingénierie est plus importante que l’itération pure du modèle.
#视频模型评测 #程序规范一致性 #AI

