IA: Modelos não superam 30% em tarefas de profissionais, aponta estudo

Um estudo da Mercor, empresa de recrutamento e treinamento, indica que modelos de inteligência artificial não superam 30% de acerto em tarefas de profissionais humanos especializados.
O estudo, que resultou no benchmark APEX-Agents, avaliou o desempenho de modelos como GPT-5.2 (OpenAI) e Gemini 3 Flash (Google) em tarefas de analistas de investimentos, consultores de gestão e advogados corporativos.
Desempenho dos Modelos
O GPT-5.2 alcançou 27,3% de acerto em tarefas de analistas de investimentos e 22,7% em consultoria de gestão. Já o Gemini 3 Flash obteve 25,9% de acerto em tarefas de advogados.
Metodologia do Estudo
O benchmark APEX-Agents utiliza prompts enviados por profissionais reais, tornando as tarefas complexas e exigindo que os agentes reúnam informações de diferentes domínios.
Brendan Foody, CEO da Mercor, explica que o ambiente do estudo foi modelado de acordo com serviços profissionais, utilizando ferramentas como Slack e Google Drive.
As questões do teste, disponibilizadas publicamente, envolviam análise de casos complexos, como o envio de dados pessoais de cidadãos europeus para servidores nos Estados Unidos, considerando políticas da empresa e legislação da União Europeia.
Nenhum modelo alcançou 30% de desempenho em qualquer uma das três tarefas avaliadas.
Sobre o autor
Mais matérias de EmpreendaNews - Redação
Discussão
0 comentários
Notícias Relacionadas

Recupere a senha do e-Título em poucos passos
Saiba como recuperar a senha do e-Título de forma fácil e rápida, seguindo um simples passo a passo.

Marvee investe em IA e prevê crescimento de 54%
Marvee investe em IA, visando aumentar faturamento para R$ 20 milhões em 2026.

Varejo ainda hesita em adotar IA, diz CEO da Kobe
Fábio Barboza, CEO da Kobe, afirma que o varejo ainda experimenta a inteligência artificial antes de adotá-la amplamente.