A Ai2 lançou o AstaBrief 8B a 2 de outubro como o modelo que alimenta o modo Fast no recurso Generate a report do Asta. O modelo descarregável recebe uma questão de investigação e excertos retirados de artigos científicos, e depois redige de uma só vez um relatório com citações. Para um investigador, a distinção importante é a origem dos artigos e aquilo que as citações sustentam: o AstaBrief redige a partir das evidências fornecidas; por si só, não é um serviço de pesquisa bibliográfica. O comunicado da Ai2 e o cartão do modelo descrevem esse limite.
A grande mudança
- O que mudou: A Ai2 integrou o AstaBrief no modo Fast do Asta e publicou os pesos do modelo e os materiais de treino.
- Por que isso importa: Segundo a Ai2, os grupos de investigação podem analisar ou adaptar o gerador de relatórios e executar o modelo de pesos abertos na sua própria infraestrutura.
- O que observar: A qualidade do relatório depende da literatura recuperada e da verificação de cada afirmação relevante na respetiva fonte. O modo Thinking do Asta, baseado no Claude, continua a ser uma opção separada, com várias etapas.
Da questão ao relatório
O percurso alojado começa no recurso Generate a report do Asta, onde o modo Fast utiliza o AstaBrief. Segundo a Ai2, o sistema de relatórios recupera literatura relevante antes de enviar a questão e os excertos ao modelo. Este redige então o relatório numa única execução, sem as etapas de extração de citações, agrupamento e redação secção a secção utilizadas pelo modo Thinking. O repositório público do ScholarQA descreve a recuperação de informação através da pesquisa de passagens e palavras-chave do Semantic Scholar, seguida de uma reordenação dos resultados; a sua implementação lite cria um prompt a partir das referências reordenadas e chama o gerador configurado. Estes são componentes documentados, não um teste da BIG CHANGE ao serviço Asta alojado.
Para executar o modelo descarregável, o cartão do modelo AstaBrief recomenda o formato de prompt a que remete e uma entrada com a questão e as referências das secções. Inclui um exemplo de código de inferência para transformers/vLLM com um máximo de 4.096 tokens de saída. No exemplo do cartão, o parâmetro model_name aponta para o checkpoint SFT, enquanto a própria página descreve a versão posterior ajustada por DPO, AstaBrief_8B; quem escolher um checkpoint deve resolver esta discrepância, em vez de presumir que o exemplo executa o modelo final tal como está publicado. A Ai2 também disponibiliza o código de exemplo do ScholarQA lite que os investigadores podem adaptar para redigir relatórios com os seus próprios PDFs. O diretório contém código; não é uma solução pronta e documentada para PDFs, nem especifica requisitos mínimos de equipamento.
Isto permite delinear uma sequência prática para uma experiência local: obter artigos cuja utilização seja permitida; extrair e selecionar passagens relevantes com os identificadores dos artigos; formatar a questão e as referências como recomenda o cartão; executar o checkpoint escolhido; e analisar o relatório juntamente com essas passagens e os artigos originais. As fontes documentam estes componentes, mas a BIG CHANGE não executou estes passos. Uma réplica local completa exige ainda decisões sobre recuperação de informação, análise de PDFs, gestão de referências e alojamento do serviço, elementos que os pesos do modelo, por si só, não fornecem.
Verifique as evidências antes de utilizar o texto
Comece pela recuperação de informação. Registe a consulta e o conjunto de artigos ou PDFs fornecidos ao gerador. Um estudo omitido ou um excerto irrelevante pode distorcer a resposta antes mesmo de o AstaBrief começar a redigir. Em seguida, consulte cada artigo citado para verificar as afirmações relevantes. Confirme se a passagem citada sustenta a frase exata, incluindo a população, o método, a data e o grau de certeza. Uma citação pode ser real e pertinente, mas o relatório pode generalizar um resultado de uma amostra a toda uma área, ou transformar uma observação descritiva numa recomendação. A Ai2 identifica explicitamente este problema de âmbito das afirmações no seu anúncio.
Por fim, procure afirmações relevantes sem citação e passagens em que o relatório se baseie repetidamente numa parte restrita dos artigos recuperados. A Ai2 afirma que filtrar os relatórios de treino pela densidade de citações melhorou os resultados obtidos durante o desenvolvimento. Esta conclusão ajuda a explicar por que razão a atribuição das fontes é importante, mas a densidade de citações, por si só, não demonstra que as afirmações citadas sejam fiéis às fontes. Trate o relatório gerado como uma síntese de trabalho a rever à luz dos artigos, sobretudo antes de o citar em investigação ou de tomar uma decisão com consequências importantes.
O que demonstra a avaliação publicada
Segundo a Ai2, considerando todo o fluxo do Asta, o modo Fast demorou em média 51,1 segundos por relatório, contra 178,5 segundos no modo Thinking — cerca de 3,5 vezes menos tempo nessa comparação. O cartão do modelo apresenta os resultados do AstaBrief nas perguntas de informática do ScholarQA-CS2 e no DeepScholarBench. O comunicado descreve também uma comparação humana separada e de pequena dimensão: três investigadores contribuíram com 14 perguntas. São avaliações da Ai2 dos seus sistemas e conjuntos de teste, não uma demonstração independente de que um relatório específico será rigoroso. O comunicado refere que a maior parte do treino e da avaliação ocorreu em 2025 e que a avaliação completa não foi refeita com os modelos de fronteira atuais.
O checkpoint final está disponível ao abrigo da licença Apache 2.0, e a Ai2 identifica os conjuntos de dados e prompts de treino numa coleção do AstaBrief. O cartão do modelo indica que este se destina à investigação e à educação, de acordo com as orientações de utilização responsável da Ai2. A nota de treino menciona oito GPUs H100 para o treino com DPO; isso não é um requisito mínimo publicado para inferência. Os materiais primários analisados não indicam o preço por relatório do Asta alojado, uma especificação mínima de GPU local nem um custo local fiável por relatório. Quem estiver a planear a implementação terá de apurar esses custos para a sua própria configuração.
Fontes e leituras complementares
- Comunicado da Ai2 de 2 de outubro explica o modo Fast atualmente disponível, a geração numa única etapa, os tempos e os limites da avaliação. As alegações de desempenho são da própria Ai2.
- Cartão do modelo AstaBrief 8B indica a licença, a utilização prevista, o prompt recomendado e o exemplo de inferência, incluindo o nome do checkpoint SFT utilizado nesse exemplo.
- Coleção AstaBrief lista os checkpoints, conjuntos de dados e prompts publicados; a sua existência não demonstra que seja possível reproduzir localmente o fluxo completo.
- Código e documentação do ScholarQA descrevem o sistema de recuperação; o gerador leve mostra como as referências reordenadas são convertidas num prompt para geração numa única etapa. Analisámos a documentação e o código, mas não os executámos.
- Repositório de avaliação do ScholarQA-CS2 disponibiliza código de benchmark e dados, incluindo informação sobre a elaboração das rubricas. Ajuda a compreender o desenho do teste; não verifica de forma independente os resultados divulgados para o AstaBrief.



