Cavora / dados
Equipes trabalhando com dados

Depoimentos

O que as equipes dizem
sobre o trabalho com a Cavora.

Relatos de engenheiros de dados, pesquisadores e coordenadores de ML que utilizaram os serviços da Cavora em projetos reais.

Página inicial

depoimentos

Relatos de clientes

Datas referentes ao encerramento de cada projeto.

TM

Tiago Morais

Engenheiro de ML · São Paulo, SP

Contratei a revisão de qualidade antes de iniciar um projeto de classificação de texto em português. O relatório veio com um nível de detalhe que eu não esperava — campo por campo, com estatísticas de preenchimento e uma lista de duplicatas que representavam quase 8% do volume. O script de limpeza funcionou sem ajuste no nosso ambiente Python. Chamada de alinhamento foi objetiva e durou 25 minutos.

Junho 2025

LB

Larissa Barbosa

Pesquisadora de NLP · Campinas, SP

Usamos o sprint de anotação para um projeto de marcação de entidades em textos jurídicos. O lote piloto foi fundamental — identificou três categorias de entidades que tinham interpretações diferentes entre a equipe da Cavora e a nossa. Sem o piloto, teríamos descoberto isso só na entrega. O relatório semanal de concordância foi útil para acompanhar se as correções de schema estavam surtindo efeito. Kappa final ficou em 0,84.

Junho 2025

RP

Rafael Pimentel

Coordenador de Dados · Belo Horizonte, MG

Contratei a elaboração das diretrizes para estruturar o trabalho da equipe interna de anotação. O documento ficou mais curto do que eu esperava — mas mais útil. As árvores de decisão cobrem exatamente os casos que geravam dúvida nos anotadores. As duas rodadas de calibração ajudaram a identificar onde as definições ainda estavam ambíguas. Após a segunda rodada, a variação entre anotadores caiu visivelmente.

Julho 2025

AN

Ana Nunes

Gerente de Produto · Porto Alegre, RS

O que mais apreciei foi a clareza no início. O documento de abertura descrevia exatamente o que seria entregue, em que formato e em quanto tempo. Sem surpresas durante o projeto. A entrega do dataset anotado veio no formato JSONL que pedimos, sem necessidade de conversão.

Junho 2025

FO

Felipe Oliveira

Cientista de Dados · Rio de Janeiro, RJ

Fizemos a revisão de qualidade antes de decidir se valeria a pena anotar o dataset inteiro ou primeiro coletar mais dados. O relatório da Cavora mostrou que dois dos cinco campos-alvo estavam com mais de 30% de registros vazios. Essa informação mudou o planejamento do projeto. O prazo de cinco dias foi cumprido.

Julho 2025

SC

Sofia Costa

Líder Técnica · Recife, PE

O sprint de anotação para bounding box em imagens de satélite foi bem conduzido. O workshop de schema na semana zero foi mais longo do que esperávamos — mas valeu o tempo, porque os critérios de sobreposição de objetos eram realmente ambíguos. As métricas semanais de IoU ajudaram a ajustar o critério antes de comprometer o volume total.

Junho 2025

estudos de caso

Projetos em detalhe

Classificação de sentimento em avaliações de e-commerce

4 semanas · Sprint de Anotação

Contexto

Equipe de produto precisava de 45.000 avaliações classificadas em positivo, neutro e negativo para treinar um modelo de moderação. O dataset era multilíngue (português e espanhol) e incluía gírias e erros ortográficos frequentes.

O que foi feito

Workshop de schema na semana zero para definir critérios para avaliações ambíguas. Piloto com 500 itens identificou três padrões de ambiguidade específicos do português. Schema ajustado antes do sprint principal. Kappa medido semanalmente.

Resultado

44.982 itens entregues em JSONL ao final da semana 4. Kappa médio de 0,87 ao longo do sprint. Dois itens rejeitados pelo segundo revisor no lote piloto foram documentados como aprendizado para o schema.

"O lote piloto salvou o projeto. Sem ele, teríamos descoberto o problema de classificação só na validação do modelo." — Coordenadora de produto

Revisão de dataset de triagem de currículos

5 dias úteis · Revisão de Qualidade

Contexto

Startup de RH com 120.000 registros de currículos e rótulos de triagem históricos. Antes de usar esses dados para treinar um modelo, precisavam entender o estado real do dataset.

O que foi feito

Perfilamento completo dos 120.000 registros em cinco dias úteis. Relatório identificou 11.400 duplicatas, desbalanceamento de classes de 78%/22% e quatro campos com potencial de dados pessoais não declarados pela empresa.

Resultado

Script de limpeza entregue em Python. Após aplicar as correções, o dataset passou de 120.000 para 106.400 registros únicos. O cliente decidiu coletar mais dados antes de iniciar o treinamento — decisão baseada no relatório.

"Não esperávamos que o nível de duplicação fosse tão alto. O script funcionou no nosso pipeline sem modificações." — Engenheiro de ML

Diretrizes para anotação de contratos jurídicos

3 semanas · Diretrizes de Anotação

Contexto

Escritório com equipe interna de seis anotadores para marcação de cláusulas em contratos. A variação entre anotadores era alta e o único guia existente era um documento de duas páginas com definições genéricas.

O que foi feito

Desenvolvimento das diretrizes com os especialistas jurídicos do escritório. Casos de borda extraídos de 200 contratos reais antes da primeira rascunho. Duas calibrações com quatro anotadores do cliente. Revisão após primeira calibração ajustou seis definições.

Resultado

Documento final de 34 páginas com 12 árvores de decisão e 48 exemplos trabalhados. Kappa medido na segunda calibração subiu de 0,61 (antes das diretrizes) para 0,79. Equipe adotou o documento como referência para novos anotadores.

"O nível de detalhe nas árvores de decisão é o que faltava no documento anterior. Os casos de borda são reais, não inventados." — Coordenadora de operações

histórico

Números acumulados

180+

projetos concluídos

4,8M+

itens anotados

≥0,82

Kappa médio nos sprints

100%

entregas dentro do prazo declarado

contato

Fale com a equipe

Rua Antônio de Albuquerque 594
Savassi, Belo Horizonte, MG

Seg–Sex, 09h00–18h00 (BRT)

Quer um orçamento para o seu projeto? A equipe retorna em até um dia útil.

Solicitar proposta

próximo passo

O seu projeto de dados pode ser o próximo.

Descreva o dataset e a fase atual do projeto. A equipe da Cavora retorna com uma proposta de escopo documentada.

Falar com a equipe