Huit exemples présentés dans la vidéo de Matthew Berman du 24 septembre appliquent le modèle Jev de TypeSafe AI à des tâches familières : nettoyer une page Web, trouver un passage, trier une boîte de réception et sélectionner des éléments d’interface. Ces démonstrations viennent de développeurs différents. Leur point commun : confier au modèle un jugement ciblé, tandis que l’application rassemble les données et applique le résultat.
Chaque extrait est plus instructif si l’on distingue la décision du travail effectué dans le code ou par un autre modèle. Il faut aussi tenir compte des erreurs qu’un utilisateur pourrait remarquer. Il s’agit de démonstrations et d’outils en phase précoce ; BIG CHANGE n’a pas évalué de façon indépendante leur exactitude ni leur fiabilité au quotidien.
Le grand changement
- Ce qui change : Des développeurs insèrent un jugement d’IA structuré dans des interactions logicielles existantes, du raccourci de navigateur à la boîte de réception. Jev renvoie un choix, un score ou une probabilité ; l’application fournit les éléments candidats et agit selon la réponse.
- Pourquoi c’est important : Une décision utile peut être prise au moment où une personne lit, cherche ou trie, sans confier toute la tâche à une interface de conversation. Cette conception rend aussi les éditeurs d’applications responsables des mauvais classements, du contenu masqué et des actions involontaires.
- À surveiller : Les prochains éléments probants devront être propres à chaque tâche : ces outils sélectionnent-ils le bon passage, préservent-ils les commandes essentielles d’une page, classent-ils correctement les courriels importants et gèrent-ils les cas incertains dans un usage courant ? Une démonstration rapide ne suffit pas à répondre à ces questions.
Un outil de nettoyage de page illustre le partage des rôles
L’extension de navigateur Unclutter de Kitze est l’exemple le plus clair. Son README de projet indique que l’extension extrait les éléments potentiels de la page et demande à Jev lesquels sont superflus. Le code du navigateur applique ensuite des règles de masquage réversibles, les enregistre par modèle de page et les réapplique sans nouvelle requête au modèle. Les utilisateurs peuvent suspendre l’extension, conserver un élément visible ou réanalyser une page. Les fenêtres de consentement aux cookies peuvent être masquées, mais l’extension ne clique pas sur Accepter ou Refuser à la place de l’utilisateur.
Cette frontière a des conséquences concrètes. Jev peut juger qu’un élément encombre la page ; il ne contrôle pas le navigateur, ne choisit pas les options de consentement et ne décide pas de la durée d’application d’une règle. Une évaluation pratique vérifierait que la navigation, les commandes d’accessibilité, les avis signalant qu’un contenu est réservé aux abonnés et les véritables options de consentement restent utilisables après le nettoyage. Le projet propose des compilations du code source et une configuration avec sa propre clé, mais son README ne présente aucune étude indépendante sur le terrain concernant ces erreurs.
Le détecteur de sites « Made with Jev », présenté à 3:29 dans la vidéo de Berman, suit un autre processus. D’après sa propre description, le navigateur mesure les styles rendus, DeepSeek V4 Flash décrit des captures d’écran, Jev juge le design et le texte selon une liste d’indices, puis DeepSeek rédige un bref verdict. Le site affiche un score de « slop » de 26 % pour anthropic.com. Il s’agit du score stylistique calculé selon la grille de l’outil. Cela ne prouve pas quelle part du site d’Anthropic a été écrite par une IA, malgré l’interprétation de Berman dans la vidéo.
Le classement de l’information est un autre type de décision
La démonstration de priorisation des courriels de Jonathan Unikowski propose de remplacer l’ordre chronologique inversé par un classement de l’importance actualisé en continu. Dans sa publication, il indique que la fonctionnalité « arrive » dans Avec. Il ne décrit ni une boîte de réception déployée, ni la définition de l’importance, ni une mesure indépendante des messages urgents manqués. L’application devrait toujours récupérer les courriels, présenter l’ordre et décider si certains sont archivés, étiquetés ou envoyés ; le rôle démontré de Jev se limite à la priorisation.
L’extension Needle de Shubham Saboo rend cette distinction plus visible. Saboo indique que Jev évalue les passages d’une page en fonction de la requête du lecteur et que l’extension met en évidence le texte correspondant directement sur la page. Son explication plus détaillée précise que Needle ne rédige pas de réponse : la phrase surlignée figure déjà sur la page. Cela modifie ce qu’un raccourci de recherche peut trouver, mais une phrase mise en évidence peut tout de même être la mauvaise. Pour tester l’outil, il faut utiliser des requêtes dont les passages pertinents sont connus, y compris des pages contenant des affirmations similaires mais contradictoires.
La publication de clips de Burhan Usman décrit la recherche d’extraits sur un sujet dans une vidéo de plus de 90 minutes. Dans le passage vidéo à 8:34, Berman suppose que le système utilise probablement une transcription ; c’est son interprétation, et non une description vérifiée du processus. La publication ne précise pas exactement les données d’entrée ou la sortie de Jev. Une application de montage doit toujours obtenir la source, établir les repères temporels et produire des clips téléchargeables. Le calendrier et le coût rapportés sont ceux d’un développeur ; aucune étude publiée ne mesure la précision ni ne détaille le travail de bout en bout.
Ce que la composition d’interface laisse à l’application
L’expérience json-render de Chris Tate assemble une interface à partir d’options contrôlées par l’application. La documentation Jev du projet est particulièrement explicite : Jev choisit les composants et leur positionnement ; le code assemble et valide la spécification ; le moteur de rendu l’affiche. Les données métier du terrain de jeu sont synthétiques, et les gestionnaires d’action s’exécutent lorsque l’utilisateur interagit. La démonstration présente donc une façon de composer une interface délimitée, et non un modèle qui écrirait et déploierait un site Web de manière autonome.
Les deux exemples créatifs explorent des choix moins risqués. L’expérience de couleurs de Matt DesLauriers associe des consignes textuelles à des palettes dans une démonstration visuelle. L’expérience emoji de Stefan, présentée à 9:52, classe des émojis en fonction d’un texte saisi. Dans les deux cas, une application affiche des éléments visuels parmi lesquels choisir. Ces publications présentent des idées d’interaction ; elles ne prouvent pas que les choix conviennent à une marque, respectent les exigences de contraste ou fonctionnent dans différentes langues et situations.
La documentation de TypeSafe explique le lien entre ces exemples. Jev évalue, à partir d’un état fourni, des questions structurées de type Choice, Score et oui/non. Choice et Score renvoient des distributions ainsi qu’une valeur de confiance, que le logiciel peut utiliser dans ses propres règles. L’entreprise recommande de tester les seuils sur la tâche réelle ; un champ de confiance ne constitue pas une mesure indépendante de l’exactitude.
Ces exemples étayent de façon crédible un principe de conception : un logiciel peut poser une question ciblée au moment opportun lorsqu’une règle fixe serait trop rigide. La place d’un outil dans le travail quotidien dépend des erreurs qu’il commet, de ce qu’il révèle ou masque, et de la possibilité donnée aux utilisateurs de revenir en arrière. Ces caractéristiques relèvent du processus complet, et pas seulement de la décision du modèle.



