Ai2 a publié AstaBrief 8B le 2 octobre comme modèle au cœur du mode Fast d’Asta, dans la fonctionnalité Generate a report. Le modèle téléchargeable reçoit une question de recherche et des extraits tirés d’articles scientifiques, puis rédige un rapport sourcé en une seule passe. Pour les chercheurs, la distinction utile porte sur la provenance des articles et sur ce que les citations étayent réellement : AstaBrief rédige à partir d’éléments fournis ; à lui seul, ce n’est pas un service de recherche bibliographique. La publication d’Ai2 et la fiche du modèle décrivent cette limite.

Le grand changement

  • Ce qui change : Ai2 a intégré AstaBrief au mode Fast d’Asta, désormais disponible, et a publié les poids du modèle ainsi que les ressources d’entraînement.
  • Pourquoi c’est important : Selon Ai2, les équipes de recherche peuvent examiner ou adapter le générateur de rapports et exécuter le modèle à poids ouverts sur leur propre infrastructure.
  • À surveiller : La qualité des rapports dépend des publications récupérées et de la vérification de chaque affirmation importante à partir de sa source. Le mode Thinking d’Asta, propulsé par Claude, reste une option distincte en plusieurs étapes.

De la question au rapport

La solution hébergée commence dans la fonctionnalité Generate a report d’Asta, où le mode Fast utilise AstaBrief. Ai2 indique que son système récupère les publications pertinentes avant de transmettre la question et les extraits au modèle. Celui-ci rédige ensuite le rapport en une seule passe, sans les étapes d’extraction des citations, de regroupement et de rédaction section par section du mode Thinking. Le dépôt public ScholarQA décrit une récupération dans les recherches par passages et par mots-clés de Semantic Scholar, suivie d’un reclassement ; son implémentation lite construit une invite à partir des références reclassées et appelle le générateur configuré. Ces éléments sont documentés ; BIG CHANGE n’a pas testé le service Asta en production.

Pour l’exécution téléchargeable, la fiche du modèle AstaBrief recommande le format d’invite qui y est présenté et une entrée contenant la question et les références par section. Elle fournit un exemple de code d’inférence transformers/vLLM avec un maximum de 4 096 jetons en sortie. Dans cet exemple, la fiche configure model_name sur le point de contrôle SFT, tandis que la page décrit le point de contrôle ultérieur affiné par DPO AstaBrief_8B ; un chercheur qui choisit un point de contrôle doit résoudre cette divergence au lieu de supposer que l’exemple exécute tel quel le modèle final. Ai2 renvoie également vers le code d’exemple ScholarQA lite que les chercheurs peuvent adapter pour produire des rapports à partir de leurs propres PDF. Le répertoire cité contient du code ; il ne s’agit pas d’une configuration PDF clé en main documentée avec une exigence matérielle minimale.

Pour une expérience locale, on peut donc suivre cette séquence : obtenir des articles que l’on est autorisé à utiliser ; extraire et sélectionner les passages pertinents avec les identifiants des articles ; formater la question et les références comme le recommande la fiche ; exécuter le point de contrôle choisi ; puis confronter le rapport obtenu aux passages et aux articles d’origine. Les sources documentent ces composants, mais BIG CHANGE n’a pas suivi ces étapes. Une reproduction locale complète nécessite aussi des choix de récupération, d’analyse des PDF, de gestion des références et de mise à disposition du service ; les seuls poids du modèle ne les fournissent pas.

Vérifier les éléments de preuve avant d’utiliser le texte

Commencez par la récupération. Consignez la requête ainsi que les articles ou PDF fournis au générateur. Une étude omise ou un extrait sans pertinence peut fausser la réponse avant même qu’AstaBrief écrive un mot. Ouvrez ensuite chaque article cité pour vérifier les affirmations importantes. Assurez-vous que le passage cité étaye la phrase précise, notamment sa population, sa méthode, sa date et son degré de certitude. Une citation peut être réelle et pertinente, alors que le rapport généralise un résultat tiré d’un seul échantillon à tout un domaine ou transforme un constat descriptif en conseil. Ai2 signale explicitement ce problème de portée des affirmations dans sa publication.

Enfin, repérez les affirmations importantes sans citation et les passages qui s’appuient de façon répétée sur une portion restreinte des articles récupérés. Ai2 indique que le filtrage des rapports d’entraînement selon leur densité de citations a amélioré les résultats de développement. Ce constat explique l’importance de l’attribution, mais la seule densité des citations ne permet pas d’établir que les affirmations citées sont fidèles aux sources. Considérez le rapport généré comme une synthèse provisoire à réviser à partir des articles, surtout avant de le citer dans une recherche ou de prendre une décision lourde de conséquences.

Ce que l’évaluation publiée permet d’établir

Ai2 indique qu’à l’échelle de l’ensemble du pipeline Asta, un rapport généré par le mode Fast prenait en moyenne 51,1 secondes, contre 178,5 secondes avec le mode Thinking, soit environ 3,5 fois plus rapidement dans cette comparaison. Sa fiche présente les résultats d’AstaBrief sur les questions d’informatique de ScholarQA-CS2 et sur DeepScholarBench ; la publication décrit aussi une comparaison humaine distincte de petite ampleur, à laquelle trois chercheurs ont contribué avec 14 questions. Ce sont les évaluations par Ai2 de ses systèmes et jeux d’essai ; elles ne démontrent pas de manière indépendante qu’un rapport particulier sera exact. Ai2 précise que l’essentiel de l’entraînement et de l’évaluation a eu lieu en 2025 et que l’évaluation complète n’a pas été relancée face aux modèles de pointe actuels.

Le point de contrôle final est publié sous licence Apache 2.0 et Ai2 répertorie les jeux de données d’entraînement et les invites dans une collection AstaBrief. La fiche indique que le modèle est destiné à la recherche et à l’enseignement, conformément aux recommandations d’Ai2 pour une utilisation responsable. Sa note d’entraînement mentionne huit GPU H100 pour l’ajustement DPO ; il ne s’agit pas d’un minimum publié pour l’inférence. Les documents primaires examinés n’indiquent ni le coût d’un rapport produit par le service Asta hébergé, ni la configuration minimale d’un GPU local, ni une estimation fiable du coût d’un rapport produit localement. Toute personne qui planifie un déploiement doit établir ces coûts pour sa propre configuration.

Sources et lectures complémentaires

  • La publication d’Ai2 du 2 octobre décrit le mode Fast disponible, la génération en une passe, les délais mesurés et les limites de l’évaluation. Les performances annoncées sont celles d’Ai2.
  • La fiche du modèle AstaBrief 8B précise la licence, l’usage prévu, le format d’invite recommandé et l’exemple d’inférence, qui mentionne le point de contrôle SFT.
  • La collection AstaBrief répertorie les points de contrôle publiés, les jeux de données et les invites ; leur présence ne prouve pas qu’une reproduction locale de bout en bout soit possible.
  • Le code et la documentation de ScholarQA décrivent le système de récupération ; le générateur lite montre comment les références reclassées deviennent une invite de génération en une passe. Nous avons examiné la documentation et le code, sans les exécuter.
  • Le dépôt d’évaluation ScholarQA-CS2 fournit le code et les données de référence, ainsi que le contexte de construction de la grille d’évaluation. Il aide à comprendre la conception du test, mais ne vérifie pas indépendamment les scores annoncés pour AstaBrief.