1Sumário executivo
Este estudo compara oito plataformas de inteligência artificial em cinquenta tarefas de direito brasileiro, no recorte de mercado de capitais, societário e governança corporativa. Cada resposta foi pontuada em quatro dimensões distintas (Correção Jurídica, Completude, Adequação de Forma e Confiabilidade da Fonte), divididas entre dois eixos (Resposta e Fonte). A avaliação foi realizada por uma avaliadora especialista, a partir de pautas com avaliação às cegas, em que as oito respostas de cada prompt aparecem codificadas e em ordem sorteada, com a chave código-plataforma selada até a devolução das notas.
A contribuição pretendida é preencher uma lacuna específica na literatura pública de benchmarks independentes: a disponibilidade ainda limitada de estudos que comparem plataformas brasileiras e estrangeiras com base em tarefas especializadas de direito brasileiro extraídas da prática profissional.1
O que os dados mostram
- No eixo Resposta, ChatGPT, Harvey e Claude apresentaram médias próximas. As faixas de incerteza das diferenças pareadas são compatíveis tanto com vantagem de uma plataforma quanto de outra ou com ausência de diferença; o estudo não fornece evidência estatística suficiente para apontar uma liderança consistente, mas tampouco demonstra equivalência. O Harvey liderou descritivamente o eixo Fonte, com média de 9,70.
- A Completude foi a dimensão com os resultados gerais mais baixos: 49,8% das respostas receberam nota intermediária e apenas 42,2% atingiram a nota máxima (Tabela 9). Isso indica que uma resposta pode estar correta no que afirma e, ainda assim, omitir elementos juridicamente relevantes.
- O desempenho das plataformas jurídicas brasileiras, Jus IA e Inspira, foi substancialmente inferior em duas categorias dependentes de fontes extraídas da base de dados da CVM: Regulação do mercado de capitais e Jurisprudência da CVM. Nessas categorias, a diferença em relação às generalistas estrangeiras foi de 5,88 pontos; nas outras oito categorias, caiu para 1,11 ponto (Tabela 7).
- No recorte de seis prompts, o modo de pesquisa profunda não apresentou vantagem uniforme. No eixo Resposta, melhorou os resultados do Gemini e da Maritaca, manteve o Harvey próximo do desempenho na busca direta e reduziu as médias do Jus IA, do Claude e do ChatGPT. Os efeitos devem ser interpretados como específicos das plataformas e tarefas avaliadas (Tabela 11).
Todos os números deste sumário são desenvolvidos, e têm sua base de cálculo evidenciada, nas seções 3 e 4.
2Metodologia
2.1 Escopo
O estudo tem como objetivo apresentar um benchmark que englobe plataformas de inteligência artificial usualmente utilizadas por advogados brasileiros no dia a dia da sua prática, desde as generalistas mais conhecidas, como ChatGPT e Claude, até plataformas jurídicas específicas, como Harvey, Jus IA e Inspira.
A escolha de qual plataforma utilizar depende de múltiplos fatores, dos quais quatro se destacam. O primeiro é o custo de acesso: plataformas gratuitas tendem a ser mais acessadas, enquanto o acesso às que dependem de assinatura ou contrato corporativo depende do quanto o advogado está disposto a destinar do seu orçamento a ferramentas de inteligência artificial, ou de o escritório onde trabalha contratar a plataforma. O segundo é a qualidade da resposta: se a resposta é razoavelmente satisfatória e verificável, a ponto de efetivamente economizar tempo. O terceiro é a natureza do trabalho jurídico: critérios distintos podem prevalecer conforme a área de atuação e a tarefa — por exemplo, um advogado de contencioso que redige peças processuais com frequência pode atribuir maior peso à cobertura de jurisprudência do que um advogado que atue no consultivo de mercado de capitais. O quarto é a confidencialidade e governança de dados: se a plataforma oferece transparência e controle suficientes sobre o tratamento das informações, incluindo eventual uso para treinamento dos modelos e as garantias e proteções do plano contratado.
Este relatório se propõe a abordar esses quatro fatores do processo de escolha, com foco no segundo, referente à qualidade da resposta. Para tanto, foi realizada a comparação das respostas das plataformas analisadas para cinquenta prompts, extraídos e adaptados da prática jurídica da avaliadora, por meio da avaliação de cada resposta com base em critérios pré-definidos, transparentes e auditáveis. Os quatro fatores voltam a ser tratados de forma conjunta na seção 4, em que os resultados são traduzidos para a decisão prática.
Por fim, este estudo também visa somar aos materiais existentes de benchmark de plataformas de inteligência artificial para o meio jurídico brasileiro, considerando as suas variáveis e fomentando a pesquisa e o desenvolvimento da indústria de legal tech no país.
2.2 Plataformas avaliadas
Foram avaliadas oito plataformas, agrupadas em quatro categorias de produto: generalista estrangeira, generalista brasileira, jurídica estrangeira e jurídica brasileira. As plataformas têm propostas de valor, bases de dados e modelos de contratação distintos. A comparação recai, portanto, sobre seu desempenho nas mesmas tarefas e não pressupõe equivalência entre os produtos. Para definir quais modelos e configurações seriam utilizados, o critério adotado foi “a melhor configuração disponível para a finalidade deste estudo na data-base de junho de 2026”, quando os prompts foram rodados. Para viabilizar o acesso aos melhores modelos e configurações, parte das plataformas foi assinada (ChatGPT, Claude, Jus IA e Inspira) e parte teve o acesso viabilizado por licença corporativa (Copilot e Harvey).
Tabela 1. Plataformas avaliadas, categoria de produto, modelo e forma de acesso.
| Plataforma1 | Categoria | Modelo2 | Acesso |
|---|---|---|---|
| ChatGPT | Generalista estrangeira | GPT-5.5 | Assinatura individual |
| Claude | Generalista estrangeira | Opus 4.8 | Assinatura individual |
| Gemini | Generalista estrangeira | 3.1 Pro | Assinatura paga Google One de 400 GB, que inclui Google AI Plus |
| Copilot | Generalista estrangeira | Não selecionável na interface testada; roteamento automático | Licença corporativa Microsoft |
| Harvey | Jurídica estrangeira | Modo Auto (roteamento automático e orquestração) | Licença corporativa |
| Maritaca | Generalista brasileira | Sabiá-4 | Camada gratuita |
| Jus IA | Jurídica brasileira | Sistema nativo da plataforma | Freemium; versão plena por assinatura individual |
| Inspira | Jurídica brasileira | Sistema nativo da plataforma | Assinatura individual; canal B2C |
1A Legora, outra plataforma jurídica estrangeira, foi considerada, mas não foi avaliada porque não oferece assinatura individual e a avaliadora não dispunha de acesso por meio de organização contratante da plataforma.
2A avaliação se deu na função de chat em todas as plataformas, exceto na Inspira, na qual os prompts relacionados à busca de precedentes de processos administrativos foram submetidos à ferramenta de busca processual própria da plataforma. A seção 3.3 detalha essa opção e seus efeitos.
2.3 Configurações fixadas
A premissa é medir cada plataforma no melhor ajuste disponível em junho de 2026, e não o modelo isolado. A comparação recai sobre o produto na configuração testada, conforme utilizado pela avaliadora.
Tabela 2. Configurações fixadas em cada plataforma na data-base de junho de 2026.
| Plataforma | Raciocínio | Fundamentação (grounding) | Onde foram inseridas as instruções-base (brief) |
|---|---|---|---|
| ChatGPT | Alto | Busca web ligada pela avaliadora | Projeto |
| Claude | Extended thinking, esforço máximo | Busca web ligada pela avaliadora | Projeto |
| Gemini | Deep Think ligado | Automático, sem controle de ativação exposto ao usuário1 | Gem |
| Copilot | Think Deeper ligado | Busca web ativa por padrão, sem alternador acionado pela avaliadora2 | Início do prompt |
| Maritaca | Não aplicável | Pesquisa na web ligada pela avaliadora | Início do prompt |
| Jus IA | Não aplicável | Fontes nativas | Início do prompt |
| Inspira | Não aplicável | Referências nativas | Início do prompt |
| Harvey | Embutido no modo Auto | Knowledge Sources: Brazil + busca web | Customização de estilo |
1No Gemini, o grounding em resultados do Google Search é automático e não expõe controle de ativação ao usuário; algumas respostas apenas documentam que são fundamentadas em resultados de busca.
2No Copilot, a busca na web é parte integrante do produto e executada por meio do Bing. Nas versões corporativas, há controles administrativos e uma opção de ativação ou desativação pelo usuário, mas a avaliadora não pôde verificar a configuração do ambiente corporativo da organização (tenant).
As mesmas instruções-base, com texto idêntico, foram fornecidas a cada plataforma como equalizador:
Você assiste uma advogada brasileira de mercado de capitais, regulatório, societário e contratos. Jurisdição: direito brasileiro vigente. Idioma: português. Regras: (1) cite a norma e o dispositivo específicos, não referências genéricas; (2) se não tiver certeza da norma vigente, diga isso em vez de inventar; (3) adeque linguagem e estrutura ao gênero pedido; (4) seja conciso; (5) não invente normas, números, dispositivos, partes ou fatos não fornecidos.
A forma de fornecimento das instruções-base variou conforme a arquitetura de cada produto, como registra a última coluna da Tabela 2: nas plataformas que disponibilizavam campo persistente dentro de um projeto, as instruções foram carregadas nesse espaço; nas demais, no início de cada prompt.
Sobre o Harvey, uma ressalva de configuração merece registro. À época da coleta, a plataforma incorporava modelos de outros fornecedores, incluindo OpenAI, Anthropic e Google, responsáveis, respectivamente, pelo ChatGPT, Claude e Gemini. O usuário podia selecionar manualmente um modelo específico ou utilizar o modo Auto, no qual, segundo o fabricante, cada consulta era direcionada ao modelo ou conjunto de modelos considerado mais adequado. A seleção manual era opcional.2
Para fins deste estudo, o modo Auto foi mantido em todas as avaliações, sem seleção manual de um modelo específico. Essa escolha preservou a uniformidade da coleta e permitiu avaliar o Harvey na configuração concebida para selecionar os modelos mais adequados a cada consulta. Os resultados refletem, portanto, o desempenho do produto em sua arquitetura multimodelo.
2.4 O banco de prompts
Os cinquenta prompts avaliados foram adaptados de interações profissionais da avaliadora com diferentes plataformas ao longo do ano anterior à pesquisa. Os temas foram intencionalmente limitados às suas áreas de especialização: direito societário, regulatório de mercado de capitais, companhias abertas e governança corporativa. Consequentemente, os prompts são restritos a essas práticas específicas do direito brasileiro, com a contrapartida de maior precisão na análise.
Para utilização neste estudo, essas interações foram anonimizadas — isto é, sem menção a clientes, operações ou qualquer informação confidencial —, reescritas em formato padronizado e resumidas de modo que cada tarefa pudesse ser respondida em um único turno, sem necessidade de perguntas complementares. A adaptação contou com auxílio do assistente de inteligência artificial do Claude; o enquadramento em categorias, a redação final e a validação de cada prompt foram definidos pela avaliadora.
Quatro regras centrais orientaram a construção do banco e motivaram a adaptação do material original: (i) formulação de prompts curtos e autossuficientes, com gabaritos objetivos, para que tanto a resposta quanto a correção independessem de perguntas complementares; (ii) adoção de gabaritos ancorados em normas e nas interpretações doutrinárias e jurisprudenciais prevalecentes na data-base da coleta; (iii) anonimização dos prompts, com exclusão de nomes e de quaisquer dados que permitissem identificar empresas, pessoas ou projetos específicos; e (iv) seleção de prompts cuja correção pudesse ser auditada por um revisor independente com acesso ao conjunto integral de materiais da pesquisa.
Os prompts foram distribuídos em dez categorias, de cinco prompts cada, correspondentes a diferentes tipos de demanda típicos das práticas delimitadas. As categorias contemplam tarefas que mobilizam capacidades distintas das plataformas e apresentam diferentes graus de dificuldade.
Tabela 3. As dez categorias do banco de prompts e o que cada uma exige da plataforma.
| Grupo | Categoria | O que a categoria exige da plataforma |
|---|---|---|
| A | Societário “puro” | Precisão conceitual sobre um instituto determinado da Lei 6.404/76 (Lei das Sociedades por Ações) e análise do dispositivo correspondente |
| B | Regulação do mercado de capitais | Leitura sistemática da regulação, considerando as orientações da área técnica da CVM |
| C | Jurisprudência da CVM | Localização de precedente do Colegiado, com número de processo e conteúdo verificáveis |
| D | Processo administrativo na CVM | Correção procedimental sobre rito, penalidades e prescrição |
| E | Doutrina e jurisprudência | Síntese de construção doutrinária com recepção pela CVM |
| F | Análise e elaboração de documentos | Leitura crítica de documento anexo e produção de minuta a partir dele |
| G | Elaboração de ato societário | Técnica de redação de ato societário, com adaptação correta ao caso concreto |
| H | Fato relevante e comunicado ao mercado | Adequação de gênero e calibragem de linguagem sob risco regulatório |
| I | Regulatório aplicado e consultas | Aplicação de norma a situação concreta, com conclusão objetiva |
| J | Generalista e transversal | Articulação de mais de um instituto societário numa mesma resposta, no contexto de uma operação |
2.5 Critérios de avaliação: dois eixos, quatro dimensões
Cada resposta foi avaliada em dois eixos separados. O eixo “Resposta” mede a qualidade do conteúdo entregue e se divide em três dimensões: Correção Jurídica, Completude e Adequação de Forma. O eixo “Fonte” mede a precisão, a especificidade, a verificabilidade e a adequação das citações e bases utilizadas, por meio da dimensão Confiabilidade da Fonte.
A separação dos dois eixos se justifica porque uma resposta pode estar substancialmente certa e não citar base legal verificável, enquanto outra pode citar adequadamente, mas errar a conclusão. Somar os dois eixos em um número único apagaria justamente a informação que o advogado usa para decidir quanto de revisão a resposta exige: resposta com os dois eixos altos pede revisão leve; resposta com conteúdo alto e fonte baixa é útil, mas as citações precisam ser conferidas uma a uma, em pesquisa paralela; resposta com conteúdo baixo é retrabalho. O BigLaw Bench utiliza estrutura semelhante, reportando separadamente um answer score e um source score3. O índice composto apresentado na seção 3.1 a seguir é secundário, apresentado apenas para conferir leitura unificada alternativa.
Cada resposta recebe nota 0, 1 ou 2 em cada uma das quatro dimensões, com base nos critérios gerais definidos antes da coleta, reproduzidos na Tabela 4, e em uma resposta esperada específica para cada prompt. Os fundamentos jurídicos e os elementos essenciais de cada resposta esperada foram registrados pela avaliadora na respectiva pauta de correção. Esses registros tornam a avaliação auditável e reduzem a margem de subjetividade.
Tabela 4. Descritores de pontuação. As três primeiras dimensões compõem o eixo Resposta; a quarta constitui, sozinha, o eixo Fonte.
| Eixo | Dimensão | Nota 0 | Nota 1 | Nota 2 |
|---|---|---|---|---|
| Resposta | Correção Jurídica | Erro material de premissa: base normativa ou conceitual errada | Núcleo certo, com imprecisão relevante | Correta, sem erros relevantes |
| Completude | Omite elementos essenciais | Cobre o principal, mas omite elemento secundário relevante | Cobre todos os pontos essenciais | |
| Adequação de Forma | Gênero ou registro errado (ex.: explica quando se pediu para redigir) | Gênero certo, com desvios materiais (prolixo, genérico) | Gênero, estrutura e registro adequados | |
| Fonte | Confiabilidade da Fonte | Cita ou se baseia em autoridade incorreta, revogada ou não verificável, ou não oferece suporte quando necessário | Cita ou se baseia em fontes parcialmente adequadas, mas genéricas, incompletas, imprecisas ou pouco verificáveis | Cita ou se baseia em fontes corretas, específicas, adequadas e verificáveis |
Ambos os eixos foram aplicados a todos os prompts. Com relação ao eixo Fonte, nos prompts em que citações formais não eram apropriadas ou necessárias para a resposta, a nota considerou a correção e a verificabilidade das bases utilizadas, a conformidade com as normas aplicáveis e, quando pertinente, a aderência aos documentos fornecidos; a mera ausência de citação formal não gerou, por si só, nota zero.
A pontuação de cada eixo é calculada da seguinte forma e reportada prioritariamente em separado:
Resposta (0 a 10) = (Correção Jurídica + Completude + Adequação de Forma) ÷ 6 × 10
Fonte (0 a 10) = Confiabilidade da Fonte ÷ 2 × 10
O divisor 6 do eixo Resposta corresponde ao máximo somado das suas três dimensões (2 + 2 + 2); o divisor 2 do eixo Fonte, ao máximo da sua única dimensão. A conversão dos resultados para uma escala comum de 0 a 10 facilita a comparação do desempenho das plataformas em cada eixo, sem eliminar a distinção conceitual entre eles. Por essa razão, a análise principal apresenta e examina separadamente as pontuações de Resposta e Fonte.
Quanto ao formato, trinta e cinco prompts pedem resposta em chat e quinze envolvem produção ou análise de documento.
2.6 Coleta e avaliação às cegas
A coleta e a avaliação foram realizadas em etapas separadas e sequenciais. A coleta foi feita por automação de navegador em todas as plataformas, exceto no Harvey, em que a coleta foi realizada manualmente devido à impossibilidade de uso da automação. O conteúdo integral de cada resposta foi salvo, sem edição, no momento da coleta, com a finalidade de viabilizar auditoria posterior sem depender de links ou dos recursos de compartilhamento oferecidos pelas plataformas. Antes de cada captura, confirmou-se que as instruções-base estavam ativas; quando não foi possível obter essa confirmação, a coleta foi descartada e refeita.
A etapa de pontuação foi completamente manual e às cegas. Para cada prompt, todas as respostas foram reunidas em uma pauta de correção, em ordem sorteada e codificadas de A a H ou de A a N, nos casos dos prompts que também rodaram em modo de pesquisa profunda (deep research), com preservação da formatação original e anonimização do conteúdo. Respostas entregues como arquivo nativo foram fornecidas à parte, no formato original anonimizado. A chave código-plataforma ficou selada em arquivo separado até a devolução das notas de cada bloco.
O papel do assistente de inteligência artificial usado no projeto foi deliberadamente limitado pela avaliadora, de forma a evitar conflito na análise, dado que o Claude é uma das plataformas avaliadas. O assistente atuou na adaptação dos prompts originais em prompts padronizados (seção 2.4); na preparação das pautas anonimizadas; e na consolidação da avaliação em planilha. Não teve papel autoral no gabarito, não pontuou nenhuma resposta e não produziu resumo ou comparação entre respostas — a comparação foi feita diretamente pela avaliadora, sobre as respostas integrais das oito plataformas, para cada um dos cinquenta prompts.
3Resultados
3.1 Desempenho agregado
Ver tabelaOcultar tabela
Tabela 5. Desempenho agregado. Médias das cinquenta avaliações da amostra principal de cada plataforma (excluindo respostas no modo de pesquisa profunda), nos dois eixos e no índice composto, em escala de 0 a 10. Plataformas ordenadas pelo índice composto.
| Plataforma | Categoria de produto | Resposta | Fonte | Índice composto | Não entregas (n/50) |
|---|---|---|---|---|---|
| Harvey | Jurídica estrangeira | 8,77 | 9,70 | 9,24 | 0 |
| ChatGPT | Generalista estrangeira | 8,87 | 9,50 | 9,19 | 0 |
| Copilot | Generalista estrangeira | 8,30 | 9,00 | 8,65 | 0 |
| Claude | Generalista estrangeira | 8,63 | 8,40 | 8,52 | 1 |
| Gemini | Generalista estrangeira | 7,53 | 6,70 | 7,12 | 2 |
| Maritaca | Generalista brasileira | 6,57 | 6,00 | 6,29 | 0 |
| Jus IA | Jurídica brasileira | 6,50 | 5,90 | 6,20 | 3 |
| Inspira | Jurídica brasileira | 6,03 | 5,70 | 5,87 | 5 |
Os eixos Resposta e Fonte são analisados separadamente. Para facilitar a leitura conjunta dos resultados, a tabela apresenta também um índice composto, calculado pela média simples das pontuações dos dois eixos — isto é, (Resposta + Fonte) ÷ 2. A fórmula atribui o mesmo peso a cada eixo, ambos expressos em escala de 0 a 10. O índice constitui apenas uma síntese descritiva; a comparação principal examina separadamente os resultados de Resposta e Fonte.
As “não entregas” correspondem a respostas em que houve recusa expressa, ausência de resultado ou falha técnica de processamento. Todas as não entregas receberam pontuação zero nas quatro dimensões de análise, o que afetou substancialmente as médias apresentadas, a depender da plataforma.
O desempenho agregado evidenciado na tabela acima comporta três leituras: a primeira diz respeito às plataformas mais bem colocadas; a segunda, ao eixo Fonte; e a terceira, à relação entre os resultados dos dois eixos.
A primeira leitura é que as diferenças entre as três plataformas mais bem colocadas no eixo Resposta são pequenas. Na amostra dos cinquenta prompts, o ChatGPT obteve média 0,10 ponto superior à do Harvey. Na análise estatística por reamostragem pareada (bootstrap), o intervalo de confiança de 95% (IC 95%)4 para essa diferença foi de −0,23 a +0,43. Isso significa que, considerada a incerteza da estimativa, os resultados são compatíveis tanto com uma vantagem de 0,23 ponto para o Harvey quanto com uma vantagem de 0,43 ponto para o ChatGPT. A diferença entre as médias do ChatGPT e do Claude foi de +0,23 (IC 95%: −0,20 a +0,73); e, entre Harvey e Claude, de +0,13 (IC 95%: −0,30 a +0,63). Como, nas três comparações, os intervalos de confiança incluem tanto valores positivos quanto negativos, não excluindo a hipótese de diferença nula entre as plataformas, não há evidência estatística de vantagem consistente entre elas. Dessa forma, os resultados posicionam ChatGPT, Harvey e Claude como um grupo de desempenho próximo no topo da classificação, sem evidência estatística suficiente para apontar a superioridade de qualquer uma delas nesse eixo.
A segunda leitura é que o Harvey obteve a maior média no eixo Fonte, com 9,70, seguido pelo ChatGPT, com 9,50, e pelo Copilot, com 9,00. A vantagem do Harvey sobre o ChatGPT foi de apenas 0,20 ponto na escala de 0 a 10, equivalente a dois pontos adicionais na soma das cinquenta avaliações na escala original da rubrica. O resultado indica desempenho elevado das duas plataformas nesse eixo e uma liderança descritiva, mas estreita, do Harvey, insuficiente, por si só, para demonstrar superioridade consistente na confiabilidade das fontes.
A terceira leitura é que os resultados dos dois eixos tendem a variar na mesma direção: em geral, as plataformas mais bem avaliadas em Resposta também figuram entre as mais bem avaliadas em Fonte. Os eixos, contudo, não são redundantes. O Harvey supera o ChatGPT em Fonte, embora obtenha pontuação ligeiramente inferior em Resposta; de forma semelhante, o Copilot supera o Claude em Fonte, apesar do resultado inferior em Resposta. Essas inversões demonstram a utilidade de apresentar os dois eixos separadamente, enquanto o índice composto funciona apenas como síntese do desempenho agregado.
3.2 Desempenho por categoria
A Tabela 6 traz as pontuações de cada plataforma no eixo Resposta, por categoria.
Ver tabelaOcultar tabela
Tabela 6. Eixo Resposta por plataforma e categoria, em escala de 0 a 10. As categorias de A a J correspondem à Tabela 3.
| Plataforma | A | B | C | D | E | F | G | H | I | J |
|---|---|---|---|---|---|---|---|---|---|---|
| ChatGPT | 8,67 | 9,67 | 10,00 | 9,33 | 10,00 | 8,00 | 7,33 | 8,00 | 9,33 | 8,33 |
| Harvey | 8,67 | 9,00 | 9,67 | 8,67 | 9,33 | 8,67 | 7,33 | 8,67 | 9,00 | 8,67 |
| Claude | 8,33 | 9,00 | 9,33 | 9,00 | 9,33 | 7,00 | 8,00 | 8,00 | 9,00 | 9,33 |
| Copilot | 8,33 | 8,33 | 9,33 | 8,67 | 9,67 | 7,00 | 6,00 | 8,33 | 8,00 | 9,33 |
| Gemini | 8,00 | 6,67 | 7,33 | 9,00 | 8,67 | 6,00 | 7,67 | 7,00 | 7,67 | 7,33 |
| Maritaca | 6,00 | 7,00 | 7,00 | 6,33 | 7,33 | 5,33 | 5,33 | 6,67 | 7,67 | 7,00 |
| Jus IA | 7,33 | 3,67 | 3,00 | 8,00 | 8,33 | 7,00 | 5,33 | 7,67 | 7,33 | 7,33 |
| Inspira | 7,00 | 4,67 | 0,00 | 7,00 | 8,33 | 6,00 | 7,00 | 6,67 | 6,33 | 7,33 |
| Média da categoria | 7,79 | 7,25 | 6,96 | 8,25 | 8,88 | 6,88 | 6,75 | 7,63 | 8,04 | 8,08 |
Duas leituras se destacam. A primeira é a variação das médias agregadas entre categorias. As duas menores médias correspondem às categorias que envolvem redação de documentos pelas plataformas — Elaboração de ato societário (6,75) e Análise e elaboração de documentos (6,88) —, enquanto as duas maiores médias correspondem às categorias que requerem explicação — Doutrina e jurisprudência (8,88) e Processo administrativo na CVM (8,25). Neste recorte, as plataformas tiveram melhor desempenho em tarefas explicativas do que em tarefas de redação.
A segunda é sobre a variação por categoria. Seis das oito plataformas variam menos de 3,7 pontos entre suas respectivas maior e menor média; as exceções são Jus IA (5,33) e Inspira (8,33), com amplitude concentrada na categoria que requer localização de precedentes da CVM. A seção 3.3, a seguir, examina esse ponto, que requer contexto para uma leitura mais especializada.
3.3 Desempenho por tipo de produto e categoria de prompt
Agrupando as plataformas por tipo de produto, a comparação por categoria fica da seguinte forma:
Tabela 7. Eixo Resposta por blocos de comparação e categoria, em ordem decrescente da amplitude. A amplitude corresponde à diferença entre a maior e a menor média dos quatro blocos e é utilizada apenas para ordenar as categorias.
| Categoria | Generalistas estrangeiras (n = 4) | Jus IA e Inspira (n = 2) | Maritaca | Harvey | Amplitude |
|---|---|---|---|---|---|
| C. Jurisprudência da CVM | 9,00 | 1,50 | 7,00 | 9,67 | 8,17 |
| B. Regulação do mercado de capitais | 8,42 | 4,17 | 7,00 | 9,00 | 4,83 |
| F. Análise e elaboração de documentos | 7,00 | 6,50 | 5,33 | 8,67 | 3,33 |
| D. Processo administrativo na CVM | 9,00 | 7,50 | 6,33 | 8,67 | 2,67 |
| A. Societário “puro” | 8,33 | 7,17 | 6,00 | 8,67 | 2,67 |
| I. Regulatório aplicado e consultas | 8,50 | 6,83 | 7,67 | 9,00 | 2,17 |
| E. Doutrina e jurisprudência | 9,42 | 8,33 | 7,33 | 9,33 | 2,08 |
| G. Elaboração de ato societário | 7,25 | 6,17 | 5,33 | 7,33 | 2,00 |
| H. Fato relevante e comunicado ao mercado | 7,83 | 7,17 | 6,67 | 8,67 | 2,00 |
| J. Generalista e transversal | 8,58 | 7,33 | 7,00 | 8,67 | 1,67 |
| Média das categorias B e C | 8,71 | 2,83 | 7,00 | 9,33 | — |
| Média das oito categorias, exceto B e C | 8,24 | 7,13 | 6,46 | 8,63 | — |
| Média dos cinquenta prompts | 8,33 | 6,27 | 6,57 | 8,77 | — |
A ordenação das dez categorias pela amplitude entre os quatro blocos de comparação mostra que as diferenças de desempenho não se distribuem uniformemente. Jurisprudência da CVM (C) apresenta a maior amplitude, de 8,17 pontos, seguida por Regulação do mercado de capitais (B), com 4,83, e Análise e elaboração de documentos (F), com 3,33. Nas demais sete categorias, a amplitude não ultrapassa 2,67 pontos. B e C destacam-se, portanto, como as categorias que mais diferenciam os blocos avaliados.
Esse resultado permite uma leitura específica do desempenho das plataformas jurídicas brasileiras. Nas categorias B e C, que concentram os prompts de pesquisa regulatória e jurisprudencial na base da CVM, Jus IA e Inspira ficam 5,88 pontos abaixo da média das generalistas estrangeiras (2,83 vs. 8,71). Nas outras oito categorias, essa diferença cai para 1,11 ponto (7,13 vs. 8,24). O déficit das plataformas jurídicas brasileiras não se distribui, portanto, de maneira uniforme, mas é substancialmente maior nas tarefas que exigem a localização de conteúdo na base de dados da CVM.
Uma hipótese compatível com esse padrão é o contexto em que essas plataformas foram construídas. O Poder Judiciário brasileiro encerrou 2025 com 75,5 milhões de processos pendentes e registrou, no mesmo ano, 40,9 milhões de casos novos (o maior volume da série histórica iniciada em 2009), com taxa de congestionamento de 62,6%. Em comparação indicativa realizada pelo CNJ com dados europeus consolidados pela Comissão Europeia para a Eficiência da Justiça (CEPEJ), o Brasil apresentou 19,18 casos novos por cem habitantes, ante 4,44 no conjunto europeu considerado.5
Nesse cenário, é plausível que as plataformas jurídicas brasileiras direcionem seus produtos a soluções voltadas à esfera judicial. As decisões do Colegiado da CVM, por sua vez, têm natureza administrativa e são divulgadas em repositório próprio, distinto dos sistemas dos tribunais judiciais. A escala desse universo é consideravelmente mais restrita: em 2025, foram julgados 49 processos administrativos sancionadores pela CVM, contra o registro de 40,9 milhões de novos casos judiciais no mesmo ano.6
Este estudo, por delimitação de escopo, não inclui prompts de contencioso judicial. As duas plataformas jurídicas brasileiras não foram, portanto, testadas nas matérias em que a sua base de dados provavelmente viabilizaria melhor desempenho.
Os resultados da Inspira exigem uma qualificação metodológica adicional. A Inspira oferece uma ferramenta complementar de busca de jurisprudência administrativa, separada do chat, com filtro específico para decisões da CVM. Em um teste amostral, o chat da plataforma não respondeu a esse tipo de consulta e direcionou o usuário à ferramenta de busca especializada. Por isso, essa ferramenta foi utilizada nos prompts de busca de precedentes da CVM. A avaliadora verificou posteriormente, contudo, que a ferramenta aceita apenas consultas por palavras-chave e não retornou resultados quando os prompts foram inseridos na íntegra. Para preservar a padronização e a comparabilidade entre plataformas, os prompts não foram reformulados como buscas por palavras-chave; manteve-se o texto integral submetido às outras sete plataformas. O resultado da categoria reflete, portanto, a interação entre o protocolo do estudo e o formato de consulta exigido pela ferramenta.
Por fim, na comparação entre os quatro blocos da Tabela 7, o Harvey apresentou as maiores médias nas duas categorias mais dependentes de fontes brasileiras, relativas à regulação e à jurisprudência da CVM. Isso não significa, contudo, que tenha liderado individualmente essas categorias: na Tabela 6, o ChatGPT obteve pontuação ligeiramente superior em ambas. Ainda assim, o desempenho elevado do Harvey é compatível com a hipótese de que a ativação do filtro Knowledge Sources: Brazil tenha contribuído para os resultados.
3.4 Desempenho por dimensão
A apresentação do desempenho nos eixos esconde em quais dimensões dentro do eixo Resposta (composto por três dimensões) as pontuações se perdem. A Tabela 8 abaixo abre as médias brutas por dimensão, em escala de 0 a 2.
Ver tabelaOcultar tabela
Tabela 8. Médias brutas por dimensão, em escala de 0 a 2. As três primeiras colunas compõem o eixo Resposta; a quarta é o eixo Fonte.
| Plataforma | Correção Jurídica | Completude | Adequação de Forma | Confiabilidade da Fonte | Adequação − Correção |
|---|---|---|---|---|---|
| ChatGPT | 1,80 | 1,72 | 1,80 | 1,90 | 0,00 |
| Harvey | 1,76 | 1,56 | 1,94 | 1,94 | +0,18 |
| Claude | 1,76 | 1,64 | 1,78 | 1,68 | +0,02 |
| Copilot | 1,72 | 1,46 | 1,80 | 1,80 | +0,08 |
| Gemini | 1,52 | 1,28 | 1,72 | 1,34 | +0,20 |
| Jus IA | 1,28 | 1,00 | 1,62 | 1,18 | +0,34 |
| Inspira | 1,26 | 0,90 | 1,46 | 1,14 | +0,20 |
| Maritaca | 1,02 | 1,18 | 1,74 | 1,20 | +0,72 |
A última coluna mostra quanto a média de Adequação de Forma supera a média de Correção Jurídica, o que indica eventual descompasso médio entre as duas dimensões ao longo dos cinquenta prompts. Nas três plataformas com maior média no eixo Resposta, esse descompasso foi pequeno: 0,00 no ChatGPT, +0,18 no Harvey e +0,02 no Claude. Por outro lado, a Maritaca foi a plataforma que apresentou a maior diferença (+0,72), resultante de média elevada em Adequação de Forma (1,74) e menor média em Correção Jurídica (1,02). Esse dado sinaliza que respostas formalmente bem apresentadas podem coexistir com menor correção jurídica e, por isso, recomenda revisão técnica cuidadosa mesmo quando a resposta “parece pronta”.
O dado mais relevante da tabela, porém, é a coluna de Completude. Nenhuma plataforma alcança 1,75, e é a única dimensão em que mesmo as líderes ficam claramente abaixo do teto. A distribuição das 400 avaliações confirma o padrão:
Ver tabelaOcultar tabela
Tabela 9. Distribuição das 400 avaliações de respostas da amostra principal em cada dimensão. Cada célula apresenta a contagem absoluta e, entre parênteses, o percentual.
| Dimensão | Nota 0 | Nota 1 | Nota 2 |
|---|---|---|---|
| Correção Jurídica | 29 (7,2%) | 136 (34,0%) | 235 (58,8%) |
| Completude | 32 (8,0%) | 199 (49,8%) | 169 (42,2%) |
| Adequação de Forma | 12 (3,0%) | 83 (20,8%) | 305 (76,2%) |
| Confiabilidade da Fonte | 21 (5,25%) | 149 (37,25%) | 230 (57,5%) |
Metade das respostas do estudo ficou na nota intermediária de Completude, porque cobriram o principal, mas deixaram de fora ao menos um elemento secundário relevante. A implicação prática disso é que a revisão exigida é menos de verificação do que está escrito e mais de identificação do que ficou de fora — um tipo de trabalho mais difícil de delegar e mais difícil de identificar que está incompleto.
3.5 Dispersão das notas e não entregas
A média é uma estatística incompleta para avaliar o conjunto. A distribuição mostra com que frequência cada plataforma devolveu respostas de alta ou baixa pontuação entre os cinquenta prompts testados.
Ver tabelaOcultar tabela
Tabela 10. Dispersão da pontuação no eixo Resposta ao longo das cinquenta avaliações de cada plataforma.
| Plataforma | Resposta | Desvio-padrão | Menor nota | Respostas ≥ 8,33 | Respostas ≤ 5,00 | Não entregas |
|---|---|---|---|---|---|---|
| ChatGPT | 8,87 | 1,18 | 6,67 | 86% | 0% | 0 |
| Harvey | 8,77 | 1,24 | 5,00 | 86% | 2% | 0 |
| Claude | 8,63 | 1,66 | 0,00 | 90% | 4% | 1 |
| Copilot | 8,30 | 1,43 | 5,00 | 78% | 8% | 0 |
| Gemini | 7,53 | 2,17 | 0,00 | 58% | 12% | 2 |
| Maritaca | 6,57 | 1,75 | 3,33 | 30% | 38% | 0 |
| Jus IA | 6,50 | 2,34 | 0,00 | 34% | 26% | 3 |
| Inspira | 6,03 | 2,54 | 0,00 | 26% | 28% | 5 |
O ChatGPT apresentou a menor dispersão de desempenho entre os cinquenta prompts testados e nenhuma resposta abaixo de 6,67. O Claude teve a maior taxa de respostas bem avaliadas (90% iguais ou superiores a 8,33, à frente de todas as outras) e, ao mesmo tempo, registrou uma não entrega, que levou sua menor nota a zero.
A Maritaca apresentou perfil distinto na amostra principal: não registrou não entregas e teve desvio-padrão intermediário (1,75), mas concentrou a maior proporção de respostas com pontuação igual ou inferior a 5,00 (38%). A ausência de falhas totais de entrega não se traduziu, portanto, em estabilidade de desempenho adequado; nesse recorte, o principal risco foi a frequência de respostas de baixa pontuação, e não a falta de output.
Na amostra principal, oito das onze não entregas ocorreram na Inspira e no Jus IA: todas as cinco da Inspira e duas das três do Jus IA concentraram-se na categoria C. As três não entregas restantes ocorreram no Gemini, com duas, e no Claude, com uma. A seção 3.3 detalha a nota metodológica aplicável à ferramenta de busca da Inspira e seus efeitos sobre os resultados da amostra principal.
Na trilha de pesquisa profunda, as duas não entregas adicionais ocorreram no mesmo prompt. Nesse caso, Claude e Jus IA não conseguiram verificar a norma mencionada no enunciado e que embasava a pergunta, motivo pelo qual não apresentaram resposta.
3.6 Modos de falha
Do total de 436 avaliações (400 da amostra principal e 36 da amostra em pesquisa profunda), 365 receberam observações qualitativas. Abaixo, estão refletidos os seis modos de falha mais frequentemente identificados, que reúnem 263 ocorrências, apresentadas em ordem de incidência.
Modo 1 — Resposta incompleta por falta de elemento secundário relevante (142 ocorrências)
O modo mais frequente e o mais difícil de detectar em revisão. A resposta estava correta no que afirmava, mas omitia ao menos um elemento secundário relevante, que variava conforme a categoria do prompt. Exemplos recorrentes foram a falta de uma hipótese legal, de uma particularidade ou exceção relevante, ou de um elemento necessário ao documento cuja minuta foi elaborada.
“Faltou mencionar as reservas admitidas pela Lei e suas limitações; hipótese restrita às companhias dos incisos I e II do §3º — impreciso; faltou referência a ao menos um processo específico.” (prompt 25, dividendo obrigatório)
Por que importa: é o erro que sobrevive à revisão superficial. Verificar se o que está escrito está certo é rápido; perceber o que deveria estar e não está exige o conhecimento que se pretendia delegar.
Modo 2 — Norma revogada ou desatualizada (31 ocorrências)
Citação de norma ou artigo revogado. O banco de prompts foi desenhado para expor esse comportamento, por meio da seleção de prompts cujo gabarito era materialmente impactado por alteração legal recente.
“Norma desatualizada e definições imprecisas — condiciona o controle compartilhado a acordo de acionistas (afirmação incorreta).” (prompt 1) · “Norma revogada pela RCVM 160.” (prompt 30)
Por que importa: é o erro mais perigoso para quem não domina o tema, porque a resposta é internamente coerente e a citação parece verificável.
Modo 3 — Prolixidade e gênero fora do padrão (31 ocorrências)
A resposta está certa, mas não tem a forma que o documento pede. É o modo dominante nas categorias de redação.
“Resposta correta e completa, mas prolixa, excessivamente extensa — fora do padrão de mercado, repetindo informações que constam na Proposta da Administração.” (prompt 29) · “A minuta está extensa, com informações que não costumam ser apresentadas neste documento, o que contradiz o art. 57 da RCVM 160, que descreve o aviso ao mercado como aviso resumido.” (prompt 30)
Por que importa: mede a distância entre a resposta e o produto de trabalho.
Modo 4 — Fonte genérica, parcial ou não verificável (30 ocorrências)
Afirmação correta sem ancoragem, norma citada sem dispositivo, ou referência que não se confirma na fonte.
“Afirmação genérica, sem fontes; resposta e conclusão incompletas: não mencionou as reservas estatutárias nem trouxe jurisprudência da CVM, expressamente solicitada no prompt.” (prompt 25) · “Conclusão com embasamento doutrinário não verificável, contrária ao entendimento do Colegiado da CVM.” (prompt 12)
Por que importa: é a diferença entre uma resposta que economiza tempo e uma que apenas o desloca para a etapa de conferência.
Modo 5 — Dispositivo errado (16 ocorrências)
Erro no artigo, no parágrafo ou no inciso citado, ainda que o conteúdo esteja substancialmente correto.
“Artigo errado (correto: art. 37); afirma que preferenciais não votam, mas podem votar, se previsto no estatuto.” (prompt 5) · “Não existe §4º no art. 26.” (prompt 30)
Por que importa: é um tipo de erro que facilmente migra do rascunho para o documento final sem ser percebido e pode impactar negativamente a credibilidade do advogado.
Modo 6 — Não entrega (13 ocorrências)
Recusa expressa, ausência de resultado ou falha técnica de processamento.
“Busca pela superfície de pesquisa (filtro Órgão Julgador = CVM) não retornou resultados; sem resposta.” (prompts 11 a 15) · “Não processou os dois templates de escritura; limite de 100 páginas-imagem.” (prompt 27)
Por que importa: a falta de resposta implica tempo gasto pelo profissional sem obtenção de resultado utilizável. Sob os critérios adotados, a não entrega pontua zero em todas as dimensões e permanece nas médias.
Uma mesma resposta pode apresentar mais de um modo de falha; as ocorrências não são, portanto, mutuamente exclusivas.
3.7 Pesquisa profunda — trilha própria
Seis prompts do banco foram rodados também no modo de pesquisa profunda (deep research) das plataformas que o ofereciam na data-base deste estudo, totalizando 36 avaliações. A avaliação seguiu os mesmos critérios definidos na seção 2.5, também por meio de pautas de correção às cegas, preservada a anonimização. Os resultados foram registrados em trilha separada e não entraram nas médias principais da seção 3.1, porque o objetivo era comparar o modo de busca direta com o modo de pesquisa profunda dentro de cada plataforma.
Ver tabelaOcultar tabela
Tabela 11. Comparação entre o modo de pesquisa profunda e o modo de busca direta, nos mesmos seis prompts. Os dois eixos são reportados separadamente.
| Plataforma | Eixo Resposta | Eixo Fonte | ||||
|---|---|---|---|---|---|---|
| Pesquisa profunda | Busca direta | Δ | Pesquisa profunda | Busca direta | Δ | |
| Gemini | 8,61 | 6,67 | +1,94 | 8,33 | 5,00 | +3,33 |
| Maritaca | 7,50 | 6,67 | +0,83 | 6,67 | 5,83 | +0,83 |
| Harvey | 9,17 | 9,44 | −0,28 | 9,17 | 9,17 | 0,00 |
| Jus IA | 4,17 | 5,00 | −0,83 | 3,33 | 3,33 | 0,00 |
| Claude | 8,06 | 9,44 | −1,39 | 7,50 | 9,17 | −1,67 |
| ChatGPT | 8,06 | 9,72 | −1,67 | 10,00 | 9,17 | +0,83 |
Os resultados indicaram que o modo de pesquisa profunda não produz aprimoramento uniforme. No eixo Resposta, o modo elevou as médias do Gemini (+1,94) e da Maritaca (+0,83), manteve o Harvey próximo do resultado da busca direta (−0,28) e reduziu as médias do Jus IA (−0,83), do Claude (−1,39) e do ChatGPT (−1,67). No eixo Fonte, os efeitos também variaram entre as plataformas.
Portanto, o resultado sugere que a utilidade do recurso de pesquisa profunda depende da plataforma e da tarefa, sem sustentar uma regra geral de ganho de desempenho. O aumento do Gemini no eixo Fonte, de 5,00 para 8,33, é o exemplo mais expressivo de ganho observado. Como a comparação abrangeu uma amostra parcial de seis prompts por plataforma, deve ser lida como indicação restrita a esse conjunto.
4Guia prático de uso
Esta seção traduz os resultados quantitativos e qualitativos para a decisão cotidiana. Ela não substitui o julgamento do advogado sobre o caso concreto e pressupõe revisão técnica de toda resposta, em qualquer plataforma.
4.1 Os quatro fatores da decisão, considerados em conjunto
A seção 2.1 identificou quatro fatores determinantes para a escolha da plataforma ideal por um advogado: custo de acesso, qualidade da resposta, natureza do trabalho jurídico e confidencialidade e governança de dados. Este estudo mede diretamente a qualidade de resposta. A decisão real, porém, não se toma por um fator isolado, razão pela qual as notas deste relatório não devem ser lidas como recomendação autônoma. Os três outros fatores são tratados a seguir, para que a leitura seja conjunta.
Quanto ao custo de acesso, as condições publicadas pelos fornecedores em agosto de 2026 são as seguintes:
Tabela 12. Condições públicas de acesso. Preços consultados nas páginas oficiais dos fornecedores em agosto de 20267.
| Plataforma | Forma de acesso | Acesso gratuito ou de teste | Plano/configuração testada1 |
|---|---|---|---|
| ChatGPT | Assinatura individual, autoatendimento | Sim, com limites de uso e de recursos | Plano Plus, US$ 20/mês |
| Claude | Assinatura individual, autoatendimento | Sim, com uso limitado | Plano Pro, US$ 20/mês |
| Gemini | Assinatura individual, autoatendimento | Sim, com limites inferiores aos planos pagos | Google AI Plus, incluído em assinatura paga Google One de 400 GB, preço regular de R$ 24,99/mês |
| Copilot | Licença corporativa Microsoft | Sim, sem custo adicional para contas corporativas qualificadas | Licença corporativa; preço específico do contrato não informado |
| Harvey | Contrato corporativo | Não | Contrato corporativo, com preço não divulgado publicamente |
| Maritaca | Chat gratuito; assinatura opcional | Sim, 10 mensagens por dia | Camada gratuita (plano pago: R$ 59,90/mês) |
| Jus IA | Assinatura individual, autoatendimento | Sim, acesso experimental limitado | Plano Profissional, preço regular de R$ 108,90/mês |
| Inspira | Assinatura individual, autoatendimento | Não, apenas teste de 3 dias | Plano individual, preço regular de R$ 248,00/mês |
1 Os preços correspondem às condições observadas na data de consulta e podem variar em razão de localização, tributos, promoções e negociação contratual. As versões dos modelos disponíveis nas assinaturas também podem ter mudado desde a realização dos testes; por isso, as condições atuais de acesso não devem ser confundidas com a configuração efetivamente avaliada.
A transparência dos preços varia entre os produtos. As plataformas brasileiras avaliadas divulgam preços de tabela em reais para alguns planos; OpenAI (ChatGPT) e Anthropic (Claude) publicam os preços dos planos individuais em dólar, com eventual conversão para reais apresentada no checkout; e a Microsoft divulga preço público de referência por usuário para o Microsoft 365 Copilot, embora as condições de contratos corporativos possam variar. O Harvey, o ChatGPT Enterprise e determinadas modalidades corporativas não apresentam preço público de contrato, de modo que a comparação de custos permanece parcial e pode não refletir condições negociadas.
A relevância da natureza do trabalho jurídico para a escolha da plataforma deve ser avaliada em dois níveis: (i) no nível macro, o contexto mais amplo da prática (a plataforma de melhor desempenho para demandas típicas de contencioso pode diferir da melhor para o consultivo de mercado de capitais); e (ii) no nível micro, as tarefas específicas de cada demanda (dentro de uma mesma área de atuação, a plataforma pode apresentar desempenhos distintos ao localizar uma norma, encontrar um precedente, explicar uma construção doutrinária, analisar documentos ou redigir uma minuta). O fator “natureza do trabalho jurídico”, portanto, deve combinar o contexto jurídico mais amplo com as tarefas específicas que serão exigidas da plataforma. Os resultados deste estudo mostram que o desempenho agregado pode ocultar essas diferenças.
A tabela a seguir resume, dentro do recorte do estudo, as implicações dos resultados por natureza do trabalho jurídico e tarefa:
Tabela 13. Implicações dos resultados por natureza do trabalho jurídico e tarefa.
| Natureza do trabalho jurídico — nível macro | Tarefas avaliadas — nível micro | Implicação para a escolha da plataforma |
|---|---|---|
| Consultivo e pesquisa jurídica | Localizar normas; explicar institutos ou construções doutrinárias; realizar pesquisa exploratória | Devem ser priorizadas a confiabilidade, a atualidade e a rastreabilidade das fontes. Harvey e ChatGPT apresentaram os melhores resultados no eixo Fonte, mas a incidência de citações a normas revogadas confirma a necessidade de conferência. Os resultados do modo de pesquisa profunda não indicaram vantagem uniforme. |
| Regulatório de mercado de capitais | Localizar precedentes da CVM; redigir documentos para atendimento à regulação, como fatos relevantes, comunicados ao mercado ou avisos ao mercado | A elevada dispersão observada na pesquisa de precedentes da CVM indica que o nível de cobertura dessa base específica deve ser verificado antes da escolha da plataforma. Na redação de documentos regulatórios, os resultados foram mais homogêneos e não indicaram vantagem decisiva de um produto. |
| Societário e contratual | Redigir atos societários e minutas; analisar documentos anexos e produzir nova minuta | A capacidade de interpretar os documentos fornecidos, observar requisitos formais e devolver arquivo editável pode ser tão relevante quanto a qualidade substantiva. A revisão profissional continua necessária, sobretudo diante da ocorrência de minutas materialmente corretas, mas fora do padrão de mercado. |
| Outras práticas | Não avaliadas | Os resultados não permitem recomendar plataformas para práticas não abrangidas pelo estudo. Essa limitação é especialmente relevante para o contencioso judicial, dada sua expressão no mercado jurídico brasileiro: não foram testadas tarefas como elaboração de peças processuais, pesquisa de jurisprudência judicial ou gestão de contencioso. |
Por fim, quanto à confidencialidade e à governança de dados, a análise deve recair sobre a modalidade de contratação efetivamente utilizada, e não apenas sobre a plataforma. Segundo informações públicas divulgadas pelos fornecedores, planos corporativos tendem a oferecer compromissos mais explícitos e controles mais amplos do que planos individuais ou gratuitos. O Harvey, por exemplo, publica os termos do seu contrato-padrão, que incluem garantias contratuais relativas ao uso e à retenção dos dados.8 Ofertas corporativas de plataformas generalistas, como ChatGPT Enterprise e Claude for Work, também divulgam proteções próprias para dados empresariais, embora não tenham sido as configurações testadas neste estudo.9 A distinção, contudo, não é absoluta: a Maritaca declara não utilizar para treinamento as conversas dos usuários, inclusive na camada gratuita.10 Como esses aspectos não foram testados nem auditados, os resultados não permitem comparar especificamente as plataformas nesse fator.
Combinados os quatro fatores, os resultados apontam soluções distintas conforme o contexto de uso. No recorte avaliado, o Harvey se apresenta como opção consistente para escritórios de grande porte (big law) com atuação consultiva, societária ou contratual. Além disso, teve baixa dispersão e liderou o eixo Fonte, apresentando desempenho elevado nas duas categorias de pesquisa mais dependentes de fontes brasileiras.
Para profissionais autônomos e escritórios de menor porte que busquem reduzir a frequência de respostas de baixa pontuação sem elevar substancialmente o custo, ChatGPT e Claude apresentaram desempenho próximo ao do Harvey e estão disponíveis em assinaturas individuais de US$ 20 mensais. Antes do uso profissional, contudo, a adequação desses planos deve ser avaliada à luz dos requisitos aplicáveis de confidencialidade e governança de dados.
A Maritaca oferece camada gratuita, mas seu desempenho foi heterogêneo: Correção Jurídica foi sua dimensão mais frágil, embora tenha pontuado bem em Adequação de Forma. Jus IA e Inspira, embora posicionadas como ferramentas jurídicas especializadas no mercado brasileiro, apresentaram variabilidade comparativamente alta e não superaram de forma consistente as plataformas generalistas. Assim, diferenças de preço, interface ou grau de especialização jurídica não eliminam a necessidade de revisão técnica rigorosa.
Essas indicações se restringem às práticas e tarefas avaliadas e não devem ser extrapoladas para outros contextos.
5Conclusão
O estudo comparou oito plataformas em cinquenta prompts correspondentes a tarefas especializadas de direito brasileiro. Os resultados não sustentam a superioridade absoluta de uma ferramenta. No eixo Resposta, ChatGPT, Harvey e Claude apresentaram médias próximas, e a análise pareada não forneceu evidência estatística suficiente para afirmar vantagem consistente de uma delas sobre as demais; isso, contudo, não demonstra equivalência. A liderança descritiva também variou conforme o eixo considerado e o uso do índice composto. Para o uso profissional, os dados ajudam a identificar padrões de desempenho, tipos recorrentes de falha e o provável grau de revisão exigido no recorte testado; não medem, por si sós, ganhos de produtividade nem o grau em que uma tarefa pode ser delegada.
Nesse contexto, a principal preocupação identificada foi a completude. A falha mais recorrente não consistiu na apresentação de informações falsas, mas na omissão de elementos juridicamente relevantes. Trata-se de um risco menos evidente: uma resposta pode estar correta no que afirma e, ainda assim, ser insuficiente. Como essa deficiência muitas vezes só pode ser identificada por quem já domina a matéria, eventuais ganhos de produtividade dependem da revisão técnica do advogado — não apenas para verificar o conteúdo apresentado, mas também para reconhecer o que deixou de ser considerado.
Essas conclusões devem ser lidas à luz das limitações descritas na seção 6 a seguir, tendo em vista que descrevem o desempenho nas tarefas, nos modelos e nas configurações especificamente testados, e não constituem avaliações definitivas das plataformas nem garantias de desempenho em outros contextos.
6Limitações
A aplicação de um protocolo comum e de critérios uniformes de avaliação permitiu comparar as plataformas em bases consistentes. Essa padronização confere utilidade à análise, mas também impõe limites à interpretação dos resultados, expostos a seguir:
- Escopo e representatividade. A amostra é restrita a cinquenta prompts correspondentes a tarefas das práticas de mercado de capitais, societário e governança corporativa. A seleção das oito plataformas não abrange todo o mercado. Foi realizada uma única execução por combinação de prompt e plataforma, de modo que o estudo não captura a variação que poderia ocorrer entre respostas sucessivas. Os resultados por categoria, baseados em cinco prompts cada, e os resultados do modo de pesquisa profunda, baseados em seis prompts por plataforma, devem ser lidos como indicações restritas ao conjunto testado.
- Avaliação das respostas. A avaliação foi conduzida por uma única especialista, sem segunda avaliação independente ou medida de concordância entre avaliadores. A identificação das plataformas foi mascarada, mas elementos como estilo, formatação e arquivos em formatos nativos podem ter permitido seu reconhecimento indireto.
- Configuração, interação e momento da avaliação. Os resultados refletem os modelos, as funcionalidades e as interfaces disponíveis em junho de 2026, utilizados segundo os fluxos específicos de cada plataforma. O protocolo adotou uma execução única a partir do prompt original, sem sucessivas rodadas de esclarecimento ou refinamento; portanto, mede a resposta inicial produzida em condições padronizadas, e não necessariamente o melhor resultado que um usuário experiente poderia obter por meio de interação iterativa. No caso da Inspira, o protocolo de prompt literal também interagiu com o formato de busca por palavras-chave da plataforma. Atualizações posteriores de modelos, funcionalidades ou interfaces podem alterar o desempenho observado.
- Dimensões não avaliadas. O estudo não inclui parâmetro humano nem mede o tempo de execução ou de revisão. Por isso, seus resultados não permitem estimar diretamente ganhos de produtividade ou o grau de delegabilidade das tarefas. Segurança, privacidade e confidencialidade também não foram testadas nem auditadas; as referências da seção 4.1 limitam-se a resumir declarações públicas dos fornecedores e não substituem a análise do plano, do contrato e dos controles efetivamente aplicáveis. Tampouco foram avaliados integração com fluxos de trabalho, facilidade de uso do produto, custo total de propriedade ou tarefas de outras práticas, inclusive de contencioso judicial.
Dentro desses limites, o estudo oferece uma base comparativa útil para identificar tendências, formular critérios de escolha e orientar verificações adicionais. Os resultados devem ser utilizados como evidência sobre o recorte específico avaliado, e não como classificação definitiva das plataformas ou garantia de desempenho em outros contextos.
O banco de prompts, os outputs anonimizados, as pautas de correção e a planilha completa de pontuação poderão ser integralmente disponibilizados para fins de auditoria ou discussão metodológica, mediante solicitação à autora.
7Referências
Almeida, T. S., Abonizio, H., Nogueira, R., & Pires, R. (2024). Sabiá-2: A new generation of Portuguese large language models [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2403.09887
Carvalho Neto, P. B. de. (2026). LegalBench-BR: A benchmark for evaluating large language models on Brazilian legal decision classification [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2604.18878
Delfino, P., Cuconato, B., Haeusler, E. H., & Rademaker, A. (2017). Passing the Brazilian OAB exam: Data preparation and some experiments [Preprint]. arXiv. https://doi.org/10.48550/arXiv.1712.05128
Guha, N., Nyarko, J., Ho, D. E., Ré, C., Chilton, A., Narayana, A., Chohlas-Wood, A., Peters, A., Waldon, B., Rockmore, D. N., Zambrano, D., Talisman, D., Hoque, E., Surani, F., Fagan, F., Sarfaty, G., Dickinson, G. M., Porat, H., Hegland, J., … Li, Z. (2023). LegalBench: A collaboratively built benchmark for measuring legal reasoning in large language models [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2308.11462
Guo, A., & Rodrigues, A. (2025). Putting AI to the Test in Real-World Legal Work: An AI evaluation report for in-house counsel. Retrieved from https://www.legalbenchmarks.ai/research/phase-1-research
HazyResearch. (n.d.). LegalBench [Benchmark website]. Stanford University. Retrieved August 17, 2026, from https://hazyresearch.stanford.edu/legalbench/
HazyResearch. (n.d.). LegalBench [Source code]. GitHub. Retrieved August 17, 2026, from https://github.com/HazyResearch/legalbench
Laitz, T., Almeida, T. S., Abonizio, H., Malaquias Junior, R., Bonás, G. K., Piau, M., Larcher, C., Pires, R., & Nogueira, R. (2026). Sabiá-4 technical report [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2603.10213
Malaquias Junior, R., Pires, R., Romero, R., & Nogueira, R. (2024). Juru: Legal Brazilian large language model from reputable sources [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2403.18140
Pacheco, E. C. B., Suriani, F. M., & Ribeiro, R. (2025). Rabula: A benchmark for evaluating LLMs in Brazilian legal tasks. In Proceedings of the First Argument Mining and Empirical Legal Research Workshop (AMELR 2025) (CEUR Workshop Proceedings, Vol. 4089, Paper 6). https://ceur-ws.org/Vol-4089/paper6.pdf
Pires, R., Malaquias Junior, R., & Nogueira, R. (2025). Automatic legal writing evaluation of LLMs [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2504.21202
Pires, R., Almeida, T. S., Larcher Junior, C., Bonás, G., Abonizio, H., Piau, M., Malaquias Junior, R., Laitz, T., & Nogueira, R. (2026). Magis-Bench: Evaluating LLMs on magistrate-level legal tasks [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2605.08437
Vals AI. (2025, February 27). Vals Legal AI Report. https://www.vals.ai/industry-reports/vlair-2-27-25
8Como citar este relatório
Ao citar este relatório, utilize o formato exigido pelo veículo ou pela instituição de destino. Os modelos abaixo referem-se a esta edição em português; ao citar a edição em inglês (https://legalaibench-brazil.netlify.app/en/), utilize o título e o endereço daquela edição.
ABNT (NBR 6023)
MINOTTO, Natalia. LegalAI Bench Brazil: avaliação comparativa de IA jurídica no direito brasileiro. [S. l.], 2026. Disponível em: https://legalaibench-brazil.netlify.app/. Acesso em: [data de acesso].
APA (7ª edição)
Minotto, N. (2026). LegalAI Bench Brazil: avaliação comparativa de IA jurídica no direito brasileiro [Relatório independente]. https://legalaibench-brazil.netlify.app/
Bluebook (21ª edição)
Natalia Minotto, LegalAI Bench Brazil: Avaliação Comparativa de IA Jurídica no Direito Brasileiro (2026), https://legalaibench-brazil.netlify.app/.
BibTeX
@misc{minotto2026legalaibench,
author = {Minotto, Natalia},
title = {LegalAI Bench Brazil: Avaliação comparativa de IA jurídica no direito brasileiro},
year = {2026},
url = {https://legalaibench-brazil.netlify.app/},
note = {Relatório bilíngue (PT/EN)}
}
Notas
- Os benchmarks públicos brasileiros identificados até a data-base concentram-se em tarefas derivadas de exames jurídicos ou na classificação de decisões judiciais. Não foram identificados estudos públicos independentes que comparassem plataformas jurídicas brasileiras e estrangeiras com base em prompts extraídos da prática profissional de um advogado que atua no âmbito do direito brasileiro. Os benchmarks internacionais identificados são predominantemente em língua inglesa e não avaliam conjuntamente o direito brasileiro e plataformas jurídicas brasileiras. ↩
- Harvey Team. (2025, 13 de maio). Expanding Harvey’s model offerings. https://www.harvey.ai/blog/expanding-harveys-model-offerings; Grupen, N. (2026, 10 de março). Why Harvey is multi-model by design. Harvey. https://www.harvey.ai/blog/why-harvey-is-multi-model-by-design. ↩
- Harvey Team. (2024, 29 de agosto). Introducing BigLaw Bench. https://www.harvey.ai/blog/introducing-biglaw-bench. Trata-se de benchmark produzido pelo próprio fornecedor avaliado. ↩
- IC 95% é uma faixa que resume a incerteza da diferença média estimada pelo procedimento de bootstrap pareado aplicado aos cinquenta prompts. Quando o intervalo abrange valores negativos e positivos, os resultados são compatíveis, dentro desse procedimento, tanto com vantagem de uma plataforma quanto da outra ou com diferença nula. Isso não demonstra equivalência nem autoriza a generalização dos resultados para além do conjunto testado. ↩
- Conselho Nacional de Justiça. (2026). Justiça em números 2026 (ano-base 2025). https://www.cnj.jus.br/wp-content/uploads/2026/06/justica-em-numeros-2026.pdf. A nota de divulgação do CNJ não detalha o critério de equivalência entre as categorias processuais brasileiras e as adotadas pela Comissão Europeia para a Eficiência da Justiça (CEPEJ), cujos ciclos de avaliação não abrangem o Brasil. Para a comparação internacional, o CNJ somou todas as instâncias e todos os tipos de processo constantes dos dados da CEPEJ. O próprio relatório adverte que os 40,9 milhões de casos novos podem incluir a contabilização do mesmo processo em diferentes fases ou instâncias no mesmo ano; considerando apenas ações originárias, processos de conhecimento e execuções extrajudiciais, o total seria de 24,7 milhões. ↩
- Comissão de Valores Mobiliários. (s.d.). Pesquisa avançada: Jurisprudência CVM. Recuperado em 12 de agosto de 2026, de https://www.gov.br/cvm/pt-br/assuntos/jurisprudencia; Comissão de Valores Mobiliários. (2026). Relatório de atividade sancionadora CVM 2025: 4º trimestre — versão resumida (pp. 15–16). https://www.gov.br/cvm/pt-br/centrais-de-conteudo/publicacoes/relatorios/relatorio-de-atividade-sancionadora/relatorio-de-atividade-sancionadora-cvm-2025-4o-trimestre-versao-resumida.pdf/view. O relatório registra 49 processos administrativos sancionadores julgados pelo Colegiado em 2025, dos quais 43 de rito ordinário e seis de rito simplificado. ↩
- Fontes consultadas em agosto de 2026: OpenAI. (s.d.). ChatGPT pricing. https://chatgpt.com/pricing; Anthropic. (s.d.). Plans & pricing. https://claude.com/pricing; Google. (s.d.). Google AI subscriptions. https://gemini.google/br/subscriptions; Microsoft. (s.d.). Microsoft 365 Copilot — preços. https://www.microsoft.com/pt-br/microsoft-365-copilot/pricing; Maritaca AI. (s.d.). Planos. https://www.maritaca.ai/planos; Jusbrasil. (s.d.). Jus IA — Planos e preços. https://ia.jusbrasil.com.br/planos; Inspira. (s.d.). Planos. https://www.inspire-se.co/; Harvey. (s.d.). Harvey. https://www.harvey.ai/ ↩
- Harvey AI Corporation. (s.d.). Secure legal AI for the most sensitive matters. Recuperado em 16 de agosto de 2026, de https://www.harvey.ai/security; Harvey AI Corporation. (s.d.). Platform Agreement. Recuperado em 16 de agosto de 2026, de https://www.harvey.ai/legal/platform-agreement. ↩
- OpenAI. (s.d.). ChatGPT Work admin FAQ. Recuperado em 16 de agosto de 2026, de https://learn.chatgpt.com/docs/enterprise/work-admin-faq; OpenAI. (s.d.). Pricing. Recuperado em 16 de agosto de 2026, de https://learn.chatgpt.com/docs/pricing; Anthropic. (s.d.). Is my data used for model training? — Commercial products. Recuperado em 16 de agosto de 2026, de https://privacy.claude.com/en/articles/7996868-is-my-data-used-for-model-training. A OpenAI informa que o ChatGPT Enterprise não utiliza dados empresariais para treinamento por padrão e oferece controles de acesso, retenção e residência de dados; a Anthropic declara que, por padrão, não utiliza os inputs e outputs de produtos comerciais, como o Claude for Work, para treinar seus modelos. ↩
- Maritaca AI. (s.d.). Inteligência artificial para o Brasil. Recuperado em 16 de agosto de 2026, de https://www.maritaca.ai/. A empresa declara que as conversas do chatbot são armazenadas para acesso posterior pelo usuário, mas não são utilizadas para treinamento, independentemente de o plano ser pago ou gratuito. ↩