Uma coalizão de 60 organizações anunciou em 21 de setembro que quer permitir que pessoas que falam idiomas pouco atendidos pelos sistemas atuais de IA usem essas ferramentas em seu próprio idioma e com sua própria voz. A Fundação Gates estima essa população em 3,4 bilhões de pessoas e estabelece um horizonte de cinco anos para a iniciativa. Google, Anthropic e a OpenAI Foundation estão entre os signatários, ao lado de organizações locais de pesquisa e organizações comunitárias. Anúncio da coalizão.

A mudança imediata é um acordo para coordenar o trabalho de acesso em diferentes idiomas. O número descreve a ambição, não as pessoas já alcançadas. Essa distinção será relevante quando chegarem os primeiros relatórios de progresso: uma interface traduzida e um serviço que entende a pergunta que uma pessoa de fato faz são conquistas diferentes.

O que a coalizão terá de construir

Os signatários propõem dados linguísticos compartilhados, avaliações de progresso e modelos e aplicativos que outros desenvolvedores possam usar. Privacidade, consentimento e controle das comunidades sobre os dados fazem parte da abordagem declarada. O anúncio deixa os detalhes da governança e das frentes de trabalho da coalizão para serem desenvolvidos ao longo do próximo ano. Os compromissos declarados.

Uma reportagem independente traz uma admissão incomumente direta sobre o ponto de partida. Elizabeth Kelly, da Anthropic, disse à Associated Press que os produtos da empresa têm desempenho ruim em muitos idiomas africanos. A AP também informa que uma secretaria acompanhará os compromissos dos participantes. São aspectos úteis de acompanhar à medida que a coalizão passa das assinaturas à entrega de resultados. Reportagem da AP.

Nossa avaliação é que o teste prático deve ser uma tarefa concluída. Uma pessoa consegue fazer uma pergunta usando sua fala cotidiana, entender a resposta e corrigir um mal-entendido? Uma pontuação impressionante em tradução escrita deixaria parte desse teste sem resposta. Um relatório público útil separaria o reconhecimento da fala da precisão e da utilidade da resposta final.

O trabalho que já acontece fora dos laboratórios de modelos

O Project Vaani mostra o que envolve coletar dados relevantes. Conduzido pelo Indian Institute of Science e pela ARTPARK, com financiamento do Google, ele busca coletar mais de 150.000 horas de fala nos distritos da Índia. Seu painel público lista atualmente cerca de 31.278 horas e 105 idiomas. O total planejado e o total registrado não devem ser confundidos. Project Vaani.

O projeto afirma que sua coleta pretende refletir diferenças como idade, gênero, escolaridade e localização urbana ou rural. Isso coloca aos desenvolvedores uma pergunta mais exigente do que saber se o produto tem uma opção de idioma no menu: de quem, entre os falantes desse idioma, ele aprendeu a reconhecer a fala?

A propriedade das gravações é outra parte do problema. Em uma atualização de maio, a Mozilla descreveu um recurso de solicitação de acesso do Mozilla Data Collective que permite a quem envia dados aprovar quem recebe seus conjuntos de dados. Sua plataforma também permite que os fornecedores especifiquem como seu material pode ser usado. O Mozilla Data Collective está entre os signatários da coalizão. Atualização da plataforma da Mozilla, termos de acesso aos conjuntos de dados.

Para uma comunidade que contribui com gravações, o acesso é uma decisão concreta. Um projeto pode perguntar quem as receberá, se o uso comercial é permitido e como uma reclamação será tratada. Essas questões devem ser resolvidas antes do início da coleta. Chamar um conjunto de dados de aberto não substitui a explicação de sua licença às pessoas cujas vozes ele contém.

Conceptual sequence: a speaker gives consent to recording, waveform data are collected, one reviewer examines a tablet on a stand, and a person uses a phone service.
From permission to data, local evaluation and a usable service: a conceptual workflow, not the coalition's implemented system. AI-generated illustration · BIG CHANGE.

O que muda para serviços públicos e empresas

Para organizações que avaliam serviços de IA, isso cria um motivo para testar localmente antes de expandir. Nossa recomendação é começar com uma tarefa rotineira e de escopo restrito e recrutar falantes fluentes do público pretendido para avaliar as respostas. Registre as falhas com o mesmo cuidado que os acertos. Inclua termos locais e formas comuns de alternar entre idiomas, em vez de testar apenas frases cuidadosamente elaboradas para uma demonstração.

Um serviço também precisa oferecer uma saída clara de uma conversa automatizada malsucedida. Uma pessoa que não consegue obter uma resposta precisa deve poder falar com um ser humano ou usar outro canal. O progresso que a coalizão vier a alcançar deve ser avaliado junto com essas alternativas, sobretudo quando um mal-entendido afeta o acesso a um serviço essencial.

Essa iniciativa surge depois de a Fundação Gates anunciar, em 14 de setembro, planos de destinar pelo menos US$ 1 bilhão ao longo de dois anos ao acesso equitativo à IA. Trata-se de um compromisso de financiamento mais amplo; o anúncio sobre idiomas não diz que todo o valor se destina a essa coalizão. O anúncio separado de financiamento.

As próximas evidências a buscar são específicas: idiomas identificados, avaliações publicadas com participantes locais, conjuntos de dados utilizáveis e serviços em funcionamento. Elas mostrariam se o acordo está tornando a IA útil para pessoas que, até agora, tiveram poucos motivos para recorrer a ela.