Em 2 de outubro, a Ai2 lançou o AstaBrief 8B, o modelo que alimenta o modo Fast no recurso Generate a report do Asta. O modelo disponível para download recebe uma pergunta de pesquisa e trechos extraídos de artigos científicos e, em uma única etapa, redige um relatório com citações. Para pesquisadores, a distinção útil é de onde vêm os artigos e o que as citações de fato sustentam: o AstaBrief redige com base nas evidências fornecidas; por si só, não é um serviço de busca bibliográfica. O anúncio da Ai2 e o cartão do modelo descrevem esse limite.

A grande mudança

  • O que mudou: A Ai2 integrou o AstaBrief ao modo Fast disponível no Asta e publicou os pesos do modelo e os materiais de treinamento.
  • Por que isso importa: Segundo a Ai2, grupos de pesquisa podem inspecionar ou adaptar o gerador de relatórios e executar o modelo de pesos abertos em sua própria infraestrutura.
  • O que observar: A qualidade do relatório depende da literatura recuperada e da verificação de cada afirmação relevante em sua fonte. O modo Thinking do Asta, baseado em Claude, continua sendo uma opção separada e com várias etapas.

Da pergunta ao relatório

O fluxo hospedado começa no recurso Generate a report do Asta, onde o modo Fast usa o AstaBrief. Segundo a Ai2, o sistema de relatórios recupera literatura relevante antes de enviar a pergunta e os trechos ao modelo. Em seguida, o modelo redige o relatório em uma única etapa, sem as fases de extração de citações, agrupamento e elaboração seção por seção usadas pelo modo Thinking. O repositório público do ScholarQA descreve a recuperação por busca de passagens e palavras-chave do Semantic Scholar, seguida de reclassificação; sua implementação lite monta um prompt com referências reclassificadas e chama o gerador configurado. Esses são componentes documentados, não um teste do serviço Asta ao vivo pela BIG CHANGE.

Para o fluxo de download, o cartão do modelo AstaBrief recomenda o formato de prompt vinculado e uma entrada com a pergunta e referências às seções. Ele fornece um exemplo de código de inferência para transformers/vLLM com limite máximo de saída de 4.096 tokens. No exemplo do cartão, o parâmetro model_name aponta para o checkpoint SFT, enquanto a própria página descreve a versão posterior ajustada por DPO, AstaBrief_8B; quem escolher um checkpoint deve resolver essa divergência, em vez de presumir que o exemplo executa o modelo final exatamente como publicado. A Ai2 também vincula código de exemplo do ScholarQA lite que pesquisadores podem adaptar para gerar relatórios a partir dos próprios PDFs. O diretório vinculado contém código; não é uma configuração pronta e documentada para PDFs com requisitos mínimos de hardware especificados.

Isso permite definir uma sequência prática para um experimento local: obter artigos que se tenha permissão para usar; extrair e selecionar passagens relevantes com os identificadores dos artigos; formatar a pergunta e as referências conforme a recomendação do cartão; executar o checkpoint escolhido; e inspecionar o relatório ao lado dessas passagens e dos artigos originais. As fontes documentam esses componentes, mas a BIG CHANGE não executou essas etapas. Uma réplica local completa também exige escolhas de recuperação, análise de PDFs, tratamento de referências e disponibilização do serviço, que os pesos do modelo, por si só, não fornecem.

Confira as evidências antes de usar o texto

Comece pela recuperação. Registre a consulta e o conjunto de artigos ou PDFs fornecidos ao gerador. Um estudo omitido ou um trecho irrelevante pode distorcer a resposta antes mesmo de o AstaBrief escrever uma palavra. Depois, abra cada artigo citado para conferir as afirmações relevantes. Verifique se a passagem citada sustenta a frase exata, incluindo a população, o método, a data e o grau de certeza. Uma citação pode ser real e pertinente, mas o relatório pode ampliar um resultado de uma amostra para toda uma área ou transformar uma constatação descritiva em recomendação. A Ai2 identifica explicitamente essa falha de escopo das afirmações em seu anúncio.

Por fim, procure afirmações importantes sem citação e trechos em que o relatório se apoia repetidamente em uma parcela limitada dos artigos recuperados. A Ai2 diz que filtrar os relatórios de treinamento pela densidade de citações melhorou os resultados de desenvolvimento. Isso ajuda a explicar por que a atribuição importa, mas a densidade de citações, por si só, não demonstra que as afirmações citadas sejam fiéis às fontes. Trate o relatório gerado como uma síntese de trabalho a ser revisada à luz dos artigos, especialmente antes de citá-lo em uma pesquisa ou de tomar uma decisão relevante.

O que a avaliação publicada demonstra

Segundo a Ai2, em todo o fluxo do Asta, o modo Fast levou em média 51,1 segundos por relatório, contra 178,5 segundos no modo Thinking — cerca de 3,5 vezes mais rápido nessa comparação. O cartão do modelo informa os resultados do AstaBrief para as perguntas de ciência da computação do ScholarQA-CS2 e para o DeepScholarBench. O anúncio também descreve uma comparação humana separada e pequena: três pesquisadores contribuíram com 14 perguntas. São avaliações da Ai2 de seus sistemas e conjuntos de teste, não uma demonstração independente de que um relatório específico será preciso. O anúncio diz que a maior parte do treinamento e da avaliação ocorreu em 2025 e que a avaliação completa não foi refeita com os modelos de fronteira atuais.

O checkpoint final está disponível sob a licença Apache 2.0, e a Ai2 lista os conjuntos de dados e prompts de treinamento em uma coleção do AstaBrief. O cartão do modelo diz que ele se destina à pesquisa e à educação, conforme as orientações de uso responsável da Ai2. A nota de treinamento menciona oito GPUs H100 para o treinamento com DPO; isso não é um requisito mínimo publicado para inferência. Os materiais primários analisados não informam o preço por relatório do Asta hospedado, uma especificação mínima de GPU local nem um custo local confiável por relatório. Quem planeja uma implantação precisa calcular esses custos para a própria configuração.

Fontes e leituras complementares

  • Anúncio da Ai2 de 2 de outubro explica o modo Fast ao vivo, a geração em uma etapa, os tempos e os limites da avaliação. As alegações de desempenho são da própria Ai2.
  • Cartão do modelo AstaBrief 8B informa a licença, o uso pretendido, a recomendação de prompt e o exemplo de inferência, que menciona o nome do checkpoint SFT.
  • Coleção do AstaBrief lista os checkpoints publicados, conjuntos de dados e prompts; a presença desses materiais não demonstra que seja possível reproduzir todo o fluxo localmente.
  • Código e documentação do ScholarQA descrevem o sistema de recuperação; o gerador lite mostra como referências reclassificadas são transformadas em um prompt para geração em uma etapa. Inspecionamos a documentação e o código; não os executamos.
  • Repositório de avaliação do ScholarQA-CS2 disponibiliza código e dados de benchmark, incluindo a elaboração das rubricas. Ajuda a explicar o desenho do teste, mas não verifica de forma independente as pontuações divulgadas pelo AstaBrief.