O Centro Nacional de Inteligência Artificial do Chile (Cenia), uma organização sem fins lucrativos, está liderando um projeto para desenvolver o Latam-GPT, um novo modelo de linguagem de grande porte para a América Latina. A proposta é ajudar a região a alcançar independência tecnológica por meio da criação de um modelo de IA de código aberto, treinado em idiomas e contextos latino-americanos. As informações são da Wired.
window._taboola = window._taboola || [];
_taboola.push({
mode: ‘organic-thumbs-feed-01-stream’,
container: ‘taboola-mid-article-saiba-mais’,
placement: ‘Mid Article Saiba Mais’,
target_type: ‘mix’
});
“O Latam-GPT é um projeto que busca criar um modelo de IA aberto, gratuito e, sobretudo, colaborativo. Trabalhamos há dois anos em um processo muito bottom-up, reunindo cidadãos de diferentes países interessados em colaborar. Mais recentemente, também surgiram iniciativas top-down, com governos começando a se interessar e a participar do projeto”, disse Álvaro Soto, diretor do CENIA, em entrevista à Wired.
“Não queremos competir com OpenAI, DeepSeek ou Google. Queremos um modelo específico para a América Latina e o Caribe, ciente dos requisitos culturais e dos desafios que isso implica, como compreender diferentes dialetos, a história da região e aspectos culturais únicos”, explica Soto.
- Quem são os brasileiros que estão entre os 100 mais influentes no mundo da IA da revista Time
- Eles parecem pensar, mas não têm ‘eu’: a ilusão perigosa de tratar chatbots de IA como pessoas
- Anthropic admite uso criminoso de sua IA Claude em ciberataques sofisticados
Para ele, modelos de gigantes da tecnologia como Google, OpenAI e Anthropic são incapazes de abranger tudo o que é relevante para a realidade da América Latina. “Precisamos nos preocupar com nossas próprias necessidades. Não podemos esperar que outros tenham tempo de perguntar o que precisamos. Diante de tecnologias tão novas e disruptivas, há espaço e necessidade para que, em nossa região, aproveitemos seus benefícios e compreendamos seus riscos. Ter essa experiência é essencial para orientar o uso da tecnologia no melhor caminho”, disse.
Para ele, isso também abre oportunidades para pesquisadores. “Hoje, acadêmicos latino-americanos têm poucas chances de interagir profundamente com esses modelos. É como se quiséssemos estudar ressonância magnética sem ter um aparelho de ressonância. O Latam-GPT busca ser essa ferramenta fundamental, permitindo que a comunidade científica possa experimentar e avançar.”
Com 33 parcerias com instituições da América Latina e do Caribe, o projeto já reuniu dados de mais de oito terabytes de texto, o equivalente a milhões de livros. Essa base de informações possibilitou o desenvolvimento de um modelo de linguagem com 50 bilhões de parâmetros, em escala comparável ao GPT-3.5, o que lhe confere capacidade média a alta para executar tarefas complexas, como raciocínio, tradução e associações.
Segundo a organização, o Latam-GPT está sendo treinado em um banco de dados regional que reúne informações de 20 países latino-americanos e da Espanha, com um total de 2.645.500 documentos. O Brasil lidera com 685 mil documentos, seguido por México (385 mil), Espanha (325 mil), Colômbia (220 mil) e Argentina (210 mil).
“Temos dado muita ênfase à geração de dados de alta qualidade. Não se trata apenas de volume, mas também de composição. Analisamos a diversidade regional para garantir que os dados não venham de forma desproporcional de apenas um país, mas que haja representação equilibrada. Se notamos que a Nicarágua está sub-representada, por exemplo, buscamos ativamente colaboradores lá. Também analisamos a diversidade de temas — política, esportes, arte e outras áreas — para ter um corpus equilibrado. E, claro, há a diversidade cultural.”
De acordo com Soto, num primeiro momento, será lançado um modelo de linguagem. “Esperamos que seu desempenho em tarefas gerais seja próximo ao dos grandes modelos comerciais, mas com desempenho superior em tópicos específicos da América Latina. A ideia é que, se perguntarmos sobre assuntos relevantes para a região, o conhecimento seja muito mais profundo”, afirma.
A proposta é que esse primeiro modelo seja o ponto de partida para o desenvolvimento de uma família de tecnologias mais avançadas no futuro, incluindo modelos capazes de lidar com imagens e vídeos, além de versões de maior porte. “Como este é um projeto aberto, queremos que outras instituições possam utilizá-lo. Um grupo na Colômbia poderia adaptá-lo para o sistema educacional, ou outro no Brasil poderia adaptá-lo para a área da saúde. A ideia é abrir caminho para que diferentes organizações gerem modelos específicos para setores como agricultura, cultura e outros”, acrescenta o diretor.
A primeira versão do Latam-GPT deverá ser lançada ainda este ano. O modelo será refinado e expandido à medida que novos parceiros estratégicos se juntem ao projeto.
–borderColorFollowMe: #4a4a4a;
–textColorFollowMe: #005880;
}






