Como estamos construindo um acervo de jurisprudência com mais de 1,2 milhão de decisões
Por que decidimos coletar jurisprudência em vez de depender de uma base pronta
A maioria das IAs jurídicas no mercado responde com base no que o modelo de linguagem já "sabe" — conhecimento genérico, sem acesso direto ao que os tribunais brasileiros estão decidindo agora. Isso funciona para perguntas conceituais, mas falha exatamente onde o advogado mais precisa: entender como um tribunal específico vem decidindo um tema específico.
Por isso, além de treinar nosso próprio modelo de machine learning com mais de 64 milhões de movimentações processuais (usado para classificar automaticamente andamentos de sentença, intimação e audiência), começamos uma frente separada: coletar diretamente das fontes oficiais dos tribunais o texto de decisões judiciais — ementas, órgão julgador, data de julgamento — para construir uma base de jurisprudência própria.
O que já temos hoje: mais de 1,2 milhão de decisões coletadas
Neste momento, o acervo tem 1.223.507 decisões judiciais, com o texto da ementa disponível em praticamente todos os registros. Já mapeamos 45 tribunais diferentes para coleta, entre Tribunais de Justiça estaduais, Tribunais Regionais do Trabalho e tribunais superiores.
A cobertura ainda não é uniforme — isso é importante dizer com transparência. Hoje, quatro tribunais concentram a maior parte do volume coletado até aqui (TJBA, TJMT, TJES e TJDFT), enquanto outros tribunais já mapeados têm apenas as primeiras dezenas ou centenas de decisões coletadas. É assim que uma coleta em larga escala funciona na prática: tribunal por tribunal, expandindo a cobertura de forma contínua, sem pausar.
A meta: 50 milhões de decisões, com cobertura nacional real
O objetivo não é só acumular volume — é ter cobertura suficiente em cada tribunal para que uma busca de jurisprudência realmente reflita como aquele tribunal específico decide, e não apenas os tribunais que são mais fáceis de coletar. A meta de longo prazo é chegar a algo em torno de 50 milhões de decisões, o que exige manter a coleta rodando de forma contínua por um bom tempo — não é um projeto que se encerra em semanas.
Não vamos publicar aqui estatísticas de "tempo médio de julgamento" ou "taxa de sucesso" por tribunal ou por tipo de ação — a coleta atual não tem os dados necessários para isso com confiabilidade (não capturamos, por exemplo, a data de protocolo do processo, só a data de julgamento), e achamos mais honesto esperar ter uma base robusta o suficiente antes de publicar esse tipo de análise.
O que isso vai significar na prática
Hoje, esse acervo é um projeto de dados em construção, separado do produto principal do Advocatix. À medida que a cobertura cresce e passa por um processo de qualidade (extração de teses jurídicas estruturadas, correção de inconsistências de datas), o objetivo é conectar essa base à pesquisa de jurisprudência que a Ju e o JusClaude já oferecem — hoje baseada em fontes públicas em tempo real — para que ela também possa se apoiar num acervo próprio, coletado e mantido pela Advocatix.
Preferimos contar esse processo em etapas reais, com números reais, a prometer uma "IA que já sabe tudo sobre jurisprudência brasileira" antes de ter, de fato, construído isso.
Este conteúdo tem finalidade informativa e não substitui a análise de um advogado habilitado sobre o seu caso específico.
Esse caso, direto no seu Advocatix.
Calculadoras, IA jurídica e monitoramento de tribunais em uma única plataforma.
Começar teste grátis