REGISTRO DOI: 10.70773/revistatopicos/791610907
RESUMO
A avaliação de risco em violência doméstica tornou-se componente relevante de políticas de proteção, decisões policiais, pedidos de medidas protetivas e gestão interinstitucional de casos. A expansão de sistemas digitais, modelos estatísticos e técnicas de inteligência artificial (IA) acrescenta capacidade de processar grandes volumes de registros e identificar padrões, mas também introduz riscos de discriminação, falsa segurança e automatização indevida de decisões que afetam direitos fundamentais. Este artigo analisa criticamente a relação entre justiça algorítmica e prevenção do feminicídio, com ênfase nos vieses de gênero e raça que podem emergir na construção, validação e uso de instrumentos de avaliação de risco policial e judicial. Adota-se revisão sistematizada qualitativa com síntese narrativa, baseada em estudos sobre instrumentos de risco de feminicídio, pesquisas com aprendizado de máquina em violência doméstica, literatura de fairness algorítmica, documentos do Sistema VioGén, legislação e normas de governança de IA da União Europeia e do Brasil. A evidência disponível demonstra que sistemas de risco podem apoiar triagem e priorização, porém não sustentam a ideia de previsão individual confiável de feminicídio nem demonstram, por si, eficácia preventiva. Estudos do VioGén e do contexto britânico mostram ganhos de discriminação preditiva em determinados modelos, mas também diferenças de desempenho entre subgrupos, dependência de dados policiais incompletos, riscos de viés de mensuração e elevada influência do desenho institucional sobre os resultados. No Brasil, o FONAR constitui instrumento estruturado de avaliação de risco, e sua digitalização não deve ser confundida automaticamente com IA. Qualquer futura automação ou modelagem preditiva deve observar a Lei Maria da Penha, a LGPD, a Resolução CNJ n. 615/2025 e salvaguardas de não discriminação, supervisão humana, auditabilidade e contestabilidade. Propõe-se a Matriz JAPI-Fem, organizada em justiça de dados, avaliação por subgrupos, proporcionalidade, intervenção humana e feedback pós-implantação. Conclui-se que a justiça algorítmica, neste domínio, exige medir não apenas acurácia global, mas também quem recebe proteção insuficiente, quem é submetido a intervenção excessiva e como erros se distribuem entre grupos racializados e socialmente vulnerabilizados.
Palavras-chave: justiça algorítmica; feminicídio; violência doméstica; avaliação de risco; inteligência artificial; viés racial; viés de gênero; polícia; Poder Judiciário.
ABSTRACT
Risk assessment in domestic violence has become an important component of protection policies, police decision-making, protective-order proceedings and multi-agency case management. The expansion of digital systems, statistical models and artificial intelligence (AI) techniques increases the capacity to process large volumes of records and identify patterns, but it also introduces risks of discrimination, false reassurance and inappropriate automation of decisions affecting fundamental rights. This article critically examines the relationship between algorithmic justice and femicide prevention, focusing on gender and racial biases that may arise in the construction, validation and use of police and judicial risk-assessment instruments. A systematized qualitative review with narrative synthesis was conducted, drawing on studies of femicide risk instruments, machine-learning research in domestic violence, algorithmic-fairness literature, documentation on Spain’s VioGén system, and legal and governance frameworks from the European Union and Brazil. Available evidence indicates that risk systems may support triage and prioritization, but does not justify claims of reliable individual femicide prediction or demonstrate preventive effectiveness on its own. Studies from VioGén and the United Kingdom show predictive gains in some models while also revealing subgroup disparities, dependence on incomplete police data, measurement-bias risks and strong effects of institutional design. In Brazil, the National Risk Assessment Form (FONAR) is a structured risk-assessment instrument, and its digitalization should not automatically be equated with AI. Any future automation or predictive modelling should comply with the Maria da Penha Law, Brazil’s General Data Protection Law, CNJ Resolution No. 615/2025, and safeguards concerning non-discrimination, meaningful human oversight, auditability and contestability. The article proposes the JAPI-Fem Matrix, structured around data justice, subgroup evaluation, proportionality, human intervention and post-deployment feedback. Algorithmic justice in this field therefore requires measuring not only global accuracy but also who is under-protected, who is over-intervened upon, and how errors are distributed across racialized and socially vulnerable groups.
Keywords: algorithmic justice; femicide; domestic violence; risk assessment; artificial intelligence; racial bias; gender bias; policing; judiciary.
1. INTRODUÇÃO
A prevenção do feminicídio enfrenta um problema epistemológico e institucional difícil: a violência letal pode ser precedida por sinais reconhecíveis, mas esses sinais aparecem de maneira desigual, fragmentada e incompleta em registros policiais, judiciais, de saúde e de assistência social. A avaliação de risco procura organizar parte dessa incerteza por meio de instrumentos estruturados, julgamento profissional e, mais recentemente, modelos estatísticos ou de inteligência artificial. Em princípio, a promessa é atraente: identificar precocemente casos de maior gravidade, alocar proteção, orientar medidas cautelares e reduzir a probabilidade de escalada. Contudo, quando um escore influencia a intensidade da resposta estatal, o problema deixa de ser apenas preditivo e torna-se também distributivo. Um erro pode significar proteção insuficiente para uma vítima classificada como de baixo risco ou, em sentido oposto, intervenção intrusiva e estigmatizante em um caso superestimado. Por isso, a discussão deve deslocar-se de “qual algoritmo é mais acurado?” para “como os erros, os benefícios e os ônus são distribuídos e revisados?” (Bailo et al., 2026).
A literatura sobre feminicídio e violência por parceiro íntimo demonstra que instrumentos de risco são úteis, mas imperfeitos. Revisões sistemáticas identificam ferramentas como Danger Assessment, Danger Assessment for Immigrants, Lethality Screen, H-Scale e outras escalas voltadas à violência grave ou letal, com propriedades psicométricas variáveis e aplicações em contextos institucionais distintos (Graham et al., 2021; Garcia-Vergara et al., 2022). A validação da Danger Assessment, por exemplo, foi baseada em estudo multicêntrico com casos de feminicídio e controles e permitiu construir categorias de risco com capacidade discriminativa relevante (Campbell; Webster; Glass, 2009). Ainda assim, nenhuma ferramenta elimina incerteza. O feminicídio é evento de baixa frequência relativa, dependente de contexto e produzido por trajetórias sociais complexas; portanto, métricas agregadas podem ocultar falhas importantes em subgrupos ou circunstâncias raras.
A chegada do aprendizado de máquina acrescentou novas possibilidades. Em bases policiais extensas, algoritmos podem combinar históricos de violência, tempo desde o último incidente, antecedentes criminais, dados contextuais e outras variáveis para estimar probabilidade de revitimização. Turner, Brown e Medina-Ariza (2022), utilizando aproximadamente 350 mil incidentes de uma força policial britânica, observaram desempenho superior de um modelo de regressão logística com elastic net em relação à classificação policial associada ao instrumento DASH. Na Espanha, pesquisas com dados do Sistema VioGén exploraram modelos híbridos de machine learning e relataram melhora de desempenho em comparação ao sistema preexistente (González-Prieto et al., 2023). Esses resultados demonstram viabilidade técnica em bases específicas, mas não equivalem a prova de prevenção de feminicídios. A revisão de escopo de Bailo et al. (2026) é explícita ao concluir que a literatura atual sustenta, no máximo, o uso de IA como componente limitado de vias humanas de reconhecimento e gestão de risco.
A justiça algorítmica exige atenção particular aos vieses de gênero e raça porque os dados utilizados não são neutros. Registros de polícia refletem quem consegue denunciar, quem é acreditado, como agentes descrevem o fato, quais condutas são tipificadas, quais campos são preenchidos e quais situações não chegam ao Estado. Registros judiciais refletem filtros processuais, capacidade de acesso à Justiça, produção de prova e decisões anteriores. Dados de saúde dependem de procura por atendimento, cobertura e qualidade da documentação. Quando modelos aprendem a partir dessas fontes, podem reproduzir desigualdades que antecedem a tecnologia. A literatura de fairness denomina esse fenômeno de viés histórico, de representação, de mensuração ou de rotulagem, a depender do estágio em que a distorção entra no ciclo de vida do sistema (Selbst et al., 2019; Suresh; Guttag, 2021).
No Brasil, essa discussão não pode ser dissociada da estrutura racial da violência letal contra mulheres. O Anuário Brasileiro de Segurança Pública 2025 registrou que 63,6% das vítimas de feminicídio em 2024 eram mulheres negras, enquanto 35,7% eram brancas, indicando uma distribuição racialmente desigual do fenômeno (Fórum Brasileiro de Segurança Pública, 2025). Esse dado não prova que um futuro algoritmo brasileiro será racialmente enviesado, mas define uma obrigação metodológica: qualquer sistema de risco que pretenda apoiar políticas de prevenção precisa demonstrar desempenho, calibração, taxas de falso negativo e falso positivo em subgrupos relevantes, inclusive por raça/cor, região, idade, deficiência, condição socioeconômica e outros marcadores quando os dados permitirem. Uma média nacional pode parecer aceitável e, simultaneamente, ocultar subproteção sistemática de um grupo.
O Brasil já dispõe do Formulário Nacional de Avaliação de Risco (FONAR), instituído pela Resolução Conjunta CNJ/CNMP n. 5/2020 e pela Lei n. 14.149/2021, destinado a identificar fatores de risco e subsidiar polícia, Ministério Público, Judiciário e rede de proteção. A versão eletrônica foi atualizada em 2025 e ampliada em 2026. É essencial, porém, distinguir digitalização de inteligência artificial: um formulário eletrônico pode organizar informações sem produzir uma predição automatizada. A distinção evita atribuir ao FONAR características que não estão documentadas e permite formular corretamente a pergunta de pesquisa: quais salvaguardas deveriam existir se sistemas de IA fossem usados para complementar a avaliação policial ou judicial de risco em violência doméstica? A questão é especialmente atual porque a Resolução CNJ n. 615/2025 estabelece governança, classificação de risco, auditoria e vedações para soluções de IA no Poder Judiciário.
Este artigo analisa, portanto, a aplicação de inteligência artificial e algoritmos de avaliação de risco em contextos de violência doméstica e prevenção do feminicídio, com foco em vieses de gênero e raça, efeitos dos falsos positivos e falsos negativos, automação decisória, transparência e governança. A pergunta norteadora é: em que condições sistemas algorítmicos podem apoiar a gestão de risco sem reproduzir ou aprofundar desigualdades que já estruturam o acesso à proteção? O objetivo geral é integrar evidências empíricas, teoria de justiça algorítmica e marcos jurídico-institucionais para propor critérios de adoção responsável. Como contribuição aplicada, apresenta-se ao final a Matriz JAPI-Fem — Justiça Algorítmica para Prevenção Interseccional do Feminicídio — destinada a organizar requisitos mínimos de dados, validação, supervisão humana, contestabilidade e monitoramento pós-implantação.
2. METODOLOGIA
O estudo foi estruturado como revisão sistematizada qualitativa com síntese narrativa. Essa denominação foi escolhida porque o objetivo é integrar literatura empírica heterogênea — validação de instrumentos, estudos de machine learning, revisões, auditorias, documentos normativos e pesquisas jurídico-institucionais — sem afirmar a realização de uma revisão sistemática formal com fluxo PRISMA próprio e contagens de triagem auditáveis. Foram priorizadas fontes capazes de sustentar diretamente os quatro eixos da análise: avaliação de risco de violência doméstica/feminicídio; desempenho de sistemas algorítmicos; fairness, discriminação e supervisão humana; e governança jurídica no Brasil e na União Europeia. A revisão também utilizou literatura de justiça algorítmica geral apenas quando necessária para explicar mecanismos de viés, distinguindo explicitamente inferências transferidas de evidências específicas sobre violência doméstica.
A busca bibliográfica concentrou-se em PubMed, SciELO, periódicos indexados de criminologia, psicologia, direito e ciência de dados, além de páginas oficiais do Conselho Nacional de Justiça, Ministério do Interior da Espanha, EUR-Lex e legislação federal brasileira. Foram utilizados termos em português, espanhol e inglês, incluindo combinações de “intimate partner violence”, “domestic abuse”, “femicide”, “intimate partner homicide”, “risk assessment”, “machine learning”, “algorithmic fairness”, “VioGén”, “DASH”, “racial bias”, “gender bias”, “police”, “judiciary”, “FONAR” e “artificial intelligence”. A literatura recente foi atualizada até outubro de 2026, com atenção especial a estudos posteriores à entrada em vigor do Regulamento Europeu de IA e às normas brasileiras recentes sobre FONAR e governança de IA no Judiciário.
Os critérios de inclusão abrangeram: estudos empíricos ou revisões sobre instrumentos de risco de violência por parceiro íntimo ou feminicídio; pesquisas de IA/aprendizado de máquina aplicadas à violência doméstica, recidivismo, homicídio doméstico ou tratamento automatizado de narrativas; estudos com análise de fairness ou desempenho por subgrupo; e documentos oficiais que estabelecem deveres de proteção, governança de dados ou requisitos para sistemas de IA de alto risco. Foram excluídos textos que prometiam “prever feminicídio” sem validação identificável, aplicações genéricas de IA sem relação com violência doméstica e materiais promocionais de empresas. Auditorias de sociedade civil foram utilizadas como evidência complementar de governança e experiência de usuárias, sempre diferenciadas de estudos acadêmicos revisados por pares.
A síntese foi organizada em uma matriz conceitual que registra, para cada fonte empírica central, o contexto, a unidade de análise, a tecnologia ou instrumento, o desfecho, as métricas reportadas, a presença de análise por subgrupos e as limitações de validade externa. A análise de fairness não foi reduzida a uma única métrica, porque diferentes definições — paridade de taxas, calibração, igualdade de oportunidade, erro proporcional — podem ser incompatíveis entre si quando as prevalências diferem entre grupos (Chouldechova, 2017; Kleinberg; Mullainathan; Raghavan, 2017). Em vez de escolher uma métrica universal, o artigo adota uma perspectiva orientada a danos: quais erros podem retirar proteção, quais podem ampliar coerção estatal e quais grupos suportam de forma desproporcional esses custos.
Quadro 1. Eixos de evidência utilizados na síntese
Eixo | Fontes principais | Pergunta analítica | Limite interpretativo |
Instrumentos de risco | Campbell et al. (2009); Graham et al. (2021); Garcia-Vergara et al. (2022). | Quais fatores e propriedades psicométricas sustentam a avaliação de letalidade ou revitimização? | Validade de instrumento não equivale à capacidade de prever um caso individual de feminicídio. |
Algoritmos policiais | López-Ossorio et al. (2016; 2021); Turner et al. (2022); González-Prieto et al. (2023). | Como modelos estatísticos ou ML alteram discriminação, calibração e priorização? | Resultados dependem do conjunto de dados, do desfecho e do contexto institucional. |
Fairness e viés | Chouldechova (2017); Selbst et al. (2019); Suresh e Guttag (2021). | Em que etapas surgem desigualdades e como métricas de equidade podem entrar em conflito? | Literatura geral de fairness orienta análise, mas não substitui validação específica em violência doméstica. |
Governança e direitos | UE (2024); CNJ (2025/2026); LGPD; Lei Maria da Penha; Lei 14.149/2021. | Quais deveres de supervisão, não discriminação, auditabilidade e proteção de dados devem reger sistemas de alto impacto? | Normas estabelecem requisitos, não comprovam eficácia de uma aplicação concreta. |
Interseccionalidade | FBSP (2025); Turner et al. (2022); Martínez Garay et al. (2025). | Como raça/etnicidade, migração e posição socioeconômica podem afetar dados e proteção? | Desigualdades observadas não devem ser automaticamente atribuídas ao algoritmo sem análise causal. |
Fonte: elaboração própria a partir da literatura e documentos analisados.
3. DA AVALIAÇÃO ESTRUTURADA DE RISCO À PREDIÇÃO ALGORÍTMICA
3.1. Instrumentos de Letalidade e Revitimização
A avaliação de risco em violência por parceiro íntimo antecede a atual onda de inteligência artificial. Instrumentos estruturados foram desenvolvidos para apoiar profissionais na identificação de fatores associados a violência repetida, violência grave ou letalidade. A Danger Assessment é um dos exemplos mais conhecidos. Campbell, Webster e Glass (2009) validaram a versão revisada a partir de casos de feminicídio por parceiro íntimo, controles e uma amostra independente de tentativas de feminicídio, incorporando fatores como ameaças, armas, escalada da violência e controle. O valor do instrumento reside menos em produzir certeza sobre o futuro e mais em organizar fatores empiricamente associados à letalidade, favorecendo perguntas que podem ser esquecidas em atendimentos sob pressão.
Revisões sistemáticas posteriores mostram que não existe uma única ferramenta universal. Graham et al. (2021) identificaram dezenas de estudos sobre instrumentos de homicídio ou reassalto em violência íntima, com diferenças de população, administração e contexto. Garcia-Vergara et al. (2022) mapearam instrumentos específicos para feminicídio ou tentativa de feminicídio e observaram níveis de validade e confiabilidade de médios a altos em algumas ferramentas, mas também heterogeneidade substancial. Essa diversidade é relevante para a justiça algorítmica: antes de introduzir machine learning, é preciso definir com precisão qual desfecho se pretende antecipar. Revitimização, lesão grave, quebra de medida protetiva e feminicídio são eventos relacionados, porém não intercambiáveis; um modelo calibrado para um deles pode ser inadequado para outro.
A taxa-base também condiciona a interpretação. Feminicídios são, felizmente, menos frequentes que episódios de violência não letal. Em eventos raros, um sistema pode alcançar alta sensibilidade ao custo de muitos falsos positivos, ou alta especificidade ao custo de perder casos realmente perigosos. O valor preditivo positivo depende da prevalência, razão pela qual resultados expressivos de AUC não devem ser traduzidos diretamente como “probabilidade de acertar quem será vítima”. Uma ferramenta pode discriminar razoavelmente casos com e sem determinado desfecho e, ainda assim, produzir poucos verdadeiros positivos entre todas as pessoas classificadas como alto risco. Essa nuance é central porque decisões de proteção exigem recursos escassos e, simultaneamente, não toleram uma lógica que trate falsos negativos como meros erros estatísticos.
3.2. O Que Muda Quando Entram Machine Learning e IA
Modelos de aprendizado de máquina alteram a escala e a flexibilidade da avaliação. Em vez de depender apenas de um questionário fixo, podem utilizar históricos policiais, temporalidade entre ocorrências, múltiplas interações e variáveis contextuais. Berk, Sorenson e Barnes (2016), em estudo sobre violência doméstica, demonstraram que machine learning pode apoiar decisões de triagem ao aprender padrões de grandes bases de dados. Mais recentemente, González-Prieto et al. (2023) aplicaram métodos híbridos a mais de quarenta mil registros do VioGén e relataram ganhos em medidas desenhadas para equilibrar proteção e sobrecarga de recursos. Esses trabalhos mostram que a modelagem pode produzir informação adicional, mas também ampliam a superfície de risco: quanto mais variáveis, fontes e vínculos são incorporados, maior o desafio de entender proveniência, representatividade e efeitos diferenciais.
A revisão de Bailo et al. (2026) ajuda a separar três funções frequentemente misturadas. A primeira é extração de informação: NLP pode identificar, em narrativas, menções a coerção, lesões ou ameaças já registradas. A segunda é classificação ou estratificação: algoritmos podem ordenar casos segundo probabilidade de determinado desfecho. A terceira é decisão: instituições podem usar o resultado para definir prioridade, encaminhamento ou proteção. As consequências éticas aumentam de uma função para outra. Um sistema que apenas localiza informação pode ser auditado como ferramenta de recuperação; um sistema que classifica risco precisa ser validado; e um sistema cuja classificação muda a proteção oferecida exige, além disso, governança processual, supervisão humana significativa e possibilidade de contestação.
O termo “inteligência artificial” deve ser usado com precisão. VioGén, em suas versões históricas, é descrito como sistema de avaliação policial estruturada com algoritmo estatístico e ponderações, não necessariamente como machine learning autônomo. A literatura recente estuda a transição ou combinação com métodos de ML, mas é incorreto tratar toda pontuação algorítmica como IA. A distinção é importante porque riscos de opacidade, atualização automática e dependência de grandes bases variam conforme a arquitetura. Do ponto de vista da justiça algorítmica, porém, mesmo um escore estatístico simples pode ter impacto elevado se sua classificação determina proteção, prioridade ou crença institucional sobre a vítima.
4. VIESES DE GÊNERO, RAÇA E INTERSECCIONALIDADE
4.1. Dados Não São uma Fotografia Neutra da Violência
A primeira fonte de viés é a seleção do que se torna dado. Violência doméstica apresenta subnotificação, repetição e trajetórias marcadas por medo, dependência econômica, filhos, migração, deficiência, isolamento e experiências anteriores com instituições. Se uma população denuncia menos por desconfiança da polícia ou por barreiras linguísticas, o histórico policial pode registrar menos incidentes justamente em grupos mais vulneráveis. Um modelo treinado nesses registros corre o risco de aprender que “menos registros” significam “menos risco”, quando parte da ausência é produzida por barreiras de acesso. Bailo et al. (2026) destacam que raça/etnia, condição migratória, posição socioeconômica e acesso a serviços podem influenciar o que entra nas bases, tornando fairness uma questão de cadeia de dados e não apenas de ajuste matemático ao final.
O problema também aparece na qualidade do preenchimento. Turner, Brown e Medina-Ariza (2022) utilizaram a etnicidade definida pelo policial como marcador disponível para análise de fairness e reconheceram que esse campo estava incompleto e sujeito a erro de mensuração. No mesmo estudo, diferenças de taxas de revitimização entre subgrupos poderiam refletir padrões reais, mas também diferenças na interação com a polícia e na qualidade da coleta. Esse exemplo ilustra uma regra geral: quando um atributo protegido é imperfeito, tanto a avaliação de discriminação quanto a correção podem tornar-se frágeis. Paradoxalmente, remover completamente raça da base não elimina viés, porque bairro, renda, histórico de contato com a polícia e outros atributos podem funcionar como proxies.
A dimensão de gênero também pode ser embutida na definição do problema. Instrumentos desenhados para violência masculina contra parceiras mulheres podem ser adequados para esse objetivo específico, mas sua transferência para relações diversas exige validação. Ao mesmo tempo, sistemas supostamente “neutros em gênero” podem obscurecer assimetrias estruturais e reduzir coerção, ameaças e controle a sinais comportamentais descontextualizados. Justiça algorítmica não significa apagar gênero, e sim modelar o fenômeno de forma coerente com a população e o desfecho, documentando quem ficou fora do escopo e evitando generalizações indevidas.
4.2. Viés de Mensuração, Rótulo e Decisão
Em aprendizado supervisionado, o “rótulo” é o desfecho que o sistema aprende a prever. Se o rótulo for nova denúncia, o modelo aprende a prever o retorno ao sistema policial, não necessariamente a ocorrência real de nova violência. Uma vítima pode sofrer agressão e não denunciar; outra pode registrar múltiplos episódios porque dispõe de rede de apoio e acesso institucional. Assim, reincidência policialmente registrada é uma variável observável imperfeita. Esse problema é particularmente grave quando se pretende falar em prevenção de feminicídio: modelos treinados para revitimização não podem ser apresentados como modelos de letalidade sem validação específica. López-Ossorio et al. (2021) mostraram, no desenvolvimento da H-Scale do VioGén, que fatores e ponderações associados à violência letal não são idênticos aos de recidiva não letal, justificando um protocolo dual.
O viés pode surgir ainda na etapa de intervenção. Quando um caso recebe classificação alta, a polícia pode oferecer proteção adicional; se a proteção funciona, o evento previsto não ocorre. O dado resultante registra um “falso positivo”, embora a ausência de violência possa ser consequência da intervenção. Esse paradoxo de prevenção dificulta a avaliação retrospectiva. De modo inverso, uma classificação baixa pode reduzir vigilância institucional e tornar o desfecho mais provável. Modelos não operam sobre um mundo passivo: eles mudam o mundo que tentam prever. Por essa razão, avaliação de desempenho precisa considerar tratamento, exposição, mudanças de protocolo e efeitos das próprias decisões sobre os desfechos.
A literatura de fairness descreve trade-offs entre métricas quando grupos possuem prevalências diferentes. Chouldechova (2017) demonstrou que, em scores de risco, calibração e igualdade simultânea de taxas de erro entre grupos podem ser matematicamente incompatíveis em determinadas condições. Kleinberg, Mullainathan e Raghavan (2017) chegaram a conclusão semelhante sobre critérios de equidade. Em violência doméstica, isso significa que “o algoritmo é justo” não pode ser uma afirmação baseada em um único número. É necessário declarar qual noção de justiça foi priorizada, por quê, quem suporta cada tipo de erro e como a decisão se relaciona ao dever estatal de proteção.
4.3. Interseccionalidade: Quando os Vieses Se Acumulam
A análise interseccional é necessária porque raça, gênero, classe, território, nacionalidade, deficiência e idade não atuam isoladamente. Uma mulher migrante, negra, com baixa renda ou deficiência pode enfrentar barreiras particulares para denunciar, produzir prova, compreender formulários ou acessar medidas protetivas. Em 2025, Martínez Garay et al. analisaram dados públicos do VioGén e apontaram indícios de discriminação indireta contra mulheres nascidas fora da Espanha, que apareciam sobrerrepresentadas em níveis de risco mais baixos e em casos inativos. Os autores ressaltaram que a falta de transparência impede verificar adequadamente as causas. Esse tipo de estudo é valioso não porque prove uma intenção discriminatória, mas porque mostra como uma distribuição de classificações pode produzir menor acesso à proteção mesmo quando o atributo nacionalidade não é explicitamente usado como “penalização”.
No Brasil, a sobrerrepresentação de mulheres negras entre vítimas de feminicídio cria um teste concreto para qualquer sistema futuro. Segundo o Fórum Brasileiro de Segurança Pública (2025), 63,6% das vítimas de feminicídio em 2024 eram negras. Uma ferramenta que apresenta boa acurácia global, mas maior taxa de falso negativo para mulheres negras, falharia exatamente onde a carga social do dano é maior. Ao mesmo tempo, uma taxa excessiva de falso positivo em determinado grupo pode gerar vigilância policial mais intensa, exposição de famílias e decisões cautelares desproporcionais. A justiça algorítmica deve, portanto, rejeitar a falsa escolha entre “proteger mais” e “discriminar menos”: o objetivo é desenhar um sistema em que a proteção seja efetiva, proporcional e auditável para todos os grupos.
A interseccionalidade também obriga a olhar para ausências nos dados. Se o conjunto de treinamento possui poucos casos de mulheres indígenas, trans, com deficiência ou residentes em regiões específicas, não é cientificamente defensável assumir que a performance observada em maioria urbana se generaliza. Nesses cenários, a resposta correta pode ser não automatizar a classificação para o subgrupo, exigir revisão especializada ou coletar dados adicionais com salvaguardas. A política pública deve reconhecer incerteza como informação, em vez de mascará-la com um escore aparentemente preciso.
Quadro 2. Fontes de viés e possíveis consequências em avaliação algorítmica de risco
Etapa | Fonte de viés | Exemplo em violência doméstica | Risco de dano | Salvaguarda |
Coleta | Subnotificação e acesso desigual | Menos registros policiais em grupos com maior desconfiança ou barreiras de acesso. | Subproteção por histórico artificialmente “baixo”. | Auditar cobertura, missingness e vias alternativas de informação. |
Mensuração | Campos subjetivos ou incompletos | Etnicidade atribuída por agente; narrativas com qualidade desigual. | Classificação diferencial por qualidade do registro. | Padronização, treinamento e avaliação de erro de mensuração. |
Rotulagem | Desfecho observável diferente do fenômeno | Nova denúncia usada como proxy de nova violência. | Aprender comportamento de denúncia em vez de violência. | Definir desfecho com precisão e validar proxies. |
Modelagem | Proxies e correlações históricas | Bairro, renda ou histórico policial reproduzem desigualdades. | Disparate impact mesmo sem uso explícito de raça. | Testes contrafactuais e métricas por subgrupo. |
Decisão | Automação e deferência ao escore | Profissional mantém recomendação sem revisão contextual. | Falsa segurança ou intervenção excessiva. | Override documentado e treinamento anti-automation bias. |
Pós-implantação | Feedback loop | Mais vigilância gera mais registros no grupo já priorizado. | Reforço cumulativo de desigualdade. | Monitoramento longitudinal e auditoria independente. |
Fonte: elaboração própria a partir da literatura e documentos analisados.
5. EVIDÊNCIAS EMPÍRICAS E EXPERIÊNCIAS INTERNACIONAIS
5.1. VioGén: Desempenho, Letalidade e Governança
A Espanha oferece um dos exemplos mais desenvolvidos de avaliação policial estruturada em violência de gênero. O Sistema VioGén integra registros e utiliza formulários de Valoración Policial del Riesgo (VPR) e de evolução do risco (VPER) para orientar medidas de proteção. Estudos prospectivos mostraram capacidade preditiva superior ao acaso e permitiram sucessivas recalibrações. López-Ossorio, González-Álvarez e Andrés-Pueyo (2016), acompanhando mulheres que haviam denunciado violência, encontraram desempenho compatível com uso de triagem, mas longe de certeza individual. A evolução posterior para o protocolo VPR5.0-H buscou responder a um problema específico: os fatores que predizem recidiva não letal não são necessariamente os mesmos que distinguem homicídio por parceiro íntimo.
No estudo de López-Ossorio et al. (2021), 2.159 registros, incluindo 159 casos de homicídio por parceiro íntimo, foram usados para desenvolver e validar uma escala complementar de homicídio. A H-Scale apresentou AUC de 0,80, sensibilidade de 84% e especificidade de 60%, com valor preditivo positivo baixo e valor preditivo negativo elevado. Esses números devem ser lidos no contexto da taxa-base: o sistema é melhor para indicar que muitos casos não culminarão em homicídio do que para afirmar que um caso classificado como alto risco culminará necessariamente em morte. O desenho dual é metodologicamente importante porque reconhece que a prevenção letal exige um alvo próprio, em vez de simplesmente elevar o peso de uma escala genérica de violência.
Em 2025, o Ministério do Interior espanhol apresentou o VioGén 2 e um novo protocolo com indicadores atualizados, calibração revista e quatro níveis de risco. A iniciativa mostra compromisso de atualização, mas também reforça a necessidade de transparência externa. A auditoria realizada pela Eticas Foundation em 2022, por engenharia reversa e entrevistas com usuárias, relatou problemas de compreensão, baixa informação às vítimas sobre seu escore e forte concordância dos policiais com a classificação automática. Como se trata de auditoria de sociedade civil, seus achados não devem ser tratados como validação científica do sistema; porém, são relevantes para governança porque evidenciam que desempenho estatístico e experiência institucional são dimensões diferentes. Um algoritmo pode ser razoavelmente calibrado e, ainda assim, produzir risco se profissionais o tratam como autoridade incontestável.
Esse ponto é reforçado pelo European Data Protection Supervisor (2025), que utilizou VioGén como exemplo ao discutir supervisão humana de decisões automatizadas. A supervisão só é “humana” se o agente possui informação, tempo, competência e autoridade real para discordar. Uma taxa muito alta de concordância pode refletir confiança legítima, mas também pode indicar automation bias. Em violência doméstica, o risco é assimétrico: uma classificação baixa pode encerrar investigação contextual justamente quando a vítima relata coerção, stalking ou separação recente. Por isso, um escore deve ser ponto de partida para gestão de risco, nunca uma autorização para interromper a escuta.
5.2. Reino Unido: DASH, Machine Learning e Fairness por Subgrupos
A experiência britânica é particularmente relevante para o debate racial porque Turner, Brown e Medina-Ariza (2022) não se limitaram a comparar acurácia. O estudo utilizou dados de aproximadamente 350 mil incidentes de abuso doméstico e avaliou modelos de machine learning em relação ao DASH, instrumento amplamente utilizado pela polícia. A regressão logística com elastic net atingiu AUC de 0,748 em violência por parceiro íntimo e 0,763 em outros tipos de abuso doméstico. Variáveis de histórico criminal e histórico de violência doméstica, especialmente o tempo desde o último incidente, contribuíram de forma importante. Os autores concluíram que as respostas do DASH adicionavam pouco à capacidade preditiva quando combinadas com outros dados policiais.
O componente de fairness mostrou, porém, que maior acurácia global não significa ausência de disparidades. Foram examinados subgrupos de etnicidade definida pelo policial e de privação socioeconômica. Os autores observaram diferenças nas métricas entre grupos e ressaltaram limitações importantes: a etnicidade estava incompleta e era atribuída pelo agente, enquanto padrões de revitimização podiam refletir tanto violência real quanto diferenças de interação com a polícia. Esse resultado é metodologicamente exemplar porque trata fairness como diagnóstico de disparidades e não como selo binário de “justo/injusto”. Em um sistema real, discrepâncias de taxa de falso negativo seriam especialmente críticas, pois implicam vítimas que não receberiam a proteção destinada aos casos classificados como alto risco.
O estudo também mostra que substituição do julgamento profissional por algoritmo não é a única alternativa. Um modelo pode ser usado para gerar uma segunda leitura independente, sinalizar inconsistências ou priorizar revisão humana. Essa arquitetura permite que o sistema computacional funcione como mecanismo de “dupla checagem”, reduzindo dependência de um único questionário sem transformar o escore em decisão. A escolha do fluxo de trabalho é tão importante quanto a escolha do algoritmo, pois a mesma predição pode produzir efeitos diferentes conforme esteja vinculada a encaminhamento obrigatório, mera recomendação ou revisão de caso multidisciplinar.
5.3. Machine Learning Emergente e Limites de Implementação
A literatura recente expandiu o uso de machine learning para diferentes tarefas: previsão de reincidência, classificação de risco, mineração de narrativas policiais, integração de registros e identificação de fatores. González-Prieto et al. (2023) propuseram métodos híbridos com dados do VioGén e relataram melhora de até 25% em medidas construídas para refletir proteção efetiva e sobrecarga de recursos. Verrey et al. (2023) utilizaram dados policiais e super learning para estudar homicídio doméstico. Karystianis et al. (2021) exploraram mineração de texto, linkage de dados policiais e de saúde e deep learning para prever futuras infrações em violência familiar e doméstica. Esses trabalhos demonstram capacidade técnica de explorar sinais distribuídos, mas não formam um corpo homogêneo de evidência nem autorizam implantação direta em novas jurisdições.
A revisão de escopo de Bailo et al. (2026), que mapeou métodos de IA em vias de risco de violência por parceiro íntimo, é especialmente cautelosa. Os autores encontraram muitos estudos de desenvolvimento e validação, mas menos trabalhos sobre implementação, supervisão humana, fairness, privacidade e ações institucionais posteriores ao alerta. A conclusão central é que o campo não sustenta “predição individual de feminicídio”. O uso mais defensável é auxiliar reconhecimento de sinais, estruturação de informação e priorização de revisão humana. Essa distinção protege a pesquisa contra solucionismo tecnológico: um modelo que detecta padrão em texto não é, por isso, um programa de prevenção; prevenção exige que o alerta chegue a uma instituição capaz de agir de forma proporcional, segura e responsável.
O problema de transportabilidade também é decisivo. Uma base desenvolvida em determinada polícia reflete leis, práticas de registro, composição demográfica e políticas locais. Aplicar o mesmo modelo em outro país pode degradar calibração mesmo que as variáveis tenham nomes idênticos. A justiça algorítmica exige validação externa antes do uso, revalidação periódica após mudanças legislativas e acompanhamento de drift. Em violência doméstica, uma alteração de política de denúncia, de proteção eletrônica ou de critérios de registro pode mudar a relação entre preditores e desfechos, tornando pesos históricos inadequados.
Quadro 3. Estudos e sistemas centrais para o debate sobre IA e risco em violência doméstica
Fonte | Contexto / amostra | Método | Achado relevante | Leitura crítica |
Campbell et al. (2009) | Casos de feminicídio, controles e tentativas de feminicídio nos EUA. | Danger Assessment com ponderação de fatores. | Boa capacidade discriminativa para letalidade/near-lethality. | Instrumento estruturado; não é IA e não elimina incerteza individual. |
López-Ossorio et al. (2021) | 2.159 registros do VioGén, 159 homicídios. | H-Scale complementar ao VPR. | AUC 0,80; sensibilidade 84%; especificidade 60%. | Mostra necessidade de alvo específico para letalidade. |
Turner et al. (2022) | ~350 mil incidentes de uma força policial britânica. | Regressão logística elastic net e outros modelos. | AUC 0,748 (IPV) e 0,763 (não-IPV); disparidades entre subgrupos. | Fairness depende de dados de etnicidade incompletos e contexto policial. |
González-Prieto et al. (2023) | Mais de 40 mil registros oficiais do VioGén. | Modelos híbridos de ML. | Melhora reportada em medidas de proteção/recursos. | Desempenho técnico requer validação independente e governança. |
Verrey et al. (2023) | Dados policiais de violência doméstica. | Super learning para homicídio doméstico. | Explora previsão de evento raro com dados institucionais. | Baixa taxa-base e validade externa limitam inferências. |
Bailo et al. (2026) | Revisão PRISMA-ScR de aplicações de IA em vias de risco IPV/feminicídio. | Mapeamento de ML, NLP, linkage, LLM e decisão assistida. | Evidência maior para reconhecimento/triagem do que para prevenção letal. | Não sustenta predição individual confiável de feminicídio. |
Fonte: elaboração própria a partir da literatura e documentos analisados.
6. FALSOS NEGATIVOS, FALSOS POSITIVOS E AUTOMAÇÃO DECISÓRIA
A avaliação de risco não pode ser julgada apenas por acurácia. Em um domínio de alta consequência, a matriz de confusão precisa ser traduzida em efeitos institucionais. Um falso negativo ocorre quando o sistema classifica como baixo risco um caso em que ocorrerá nova violência grave ou letal; o dano potencial é subproteção, falsa tranquilização e atraso na resposta. Um falso positivo ocorre quando um caso é classificado como alto risco sem que o desfecho se manifeste; isso pode significar uso de recursos, monitoramento ou medidas restritivas que talvez não fossem necessárias. Entretanto, nem todo falso positivo estatístico é erro substantivo, pois a própria intervenção pode ter impedido o evento. A avaliação deve considerar causalidade e política de proteção, não apenas comparação retrospectiva com um desfecho observado.
Em prevenção do feminicídio, falsos negativos merecem atenção prioritária porque o custo pode ser irreversível. Isso não significa adotar um sistema que classifique todos os casos como alto risco. Uma política assim perderia capacidade de priorização e poderia saturar serviços, diminuindo qualidade de proteção para quem mais necessita. A questão é determinar um limiar transparente, sustentado por capacidade institucional e complementado por regras de segurança: determinados fatores críticos — ameaça de morte, acesso a armas, estrangulamento, stalking, separação, descumprimento de medida — podem justificar revisão humana obrigatória independentemente do escore agregado. O design adequado combina score e “red flags”, em vez de permitir que uma média estatística neutralize sinais de letalidade.
A automação introduz outro risco: profissionais podem tratar a saída do sistema como recomendação objetiva e reduzir investigação própria. Esse automation bias é especialmente perigoso quando o algoritmo é apresentado com precisão numérica, cores ou categorias que comunicam certeza maior do que existe. Supervisão humana significativa exige explicação do motivo do alerta, acesso aos principais fatores, indicação de incerteza e responsabilidade institucional pelo override. Se um agente pode alterar o escore apenas formalmente, mas teme sanção por discordar, a supervisão é ilusória. Do mesmo modo, se a instituição não monitora padrões de concordância, não sabe se o algoritmo virou decisão de fato.
A contestabilidade deve incluir a vítima. Em muitos sistemas, a pessoa avaliada conhece pouco sobre o risco atribuído, os fatores considerados e o efeito dessa classificação. Uma política centrada em direitos deve explicar, em linguagem acessível e sem expor informações que aumentem perigo, como o resultado influencia medidas de proteção, quais dados podem ser corrigidos e como informações contextuais podem ser acrescentadas. A vítima não deve ter de “provar que o algoritmo está errado” para ser ouvida; a avaliação automatizada é uma fonte de informação, não um substituto da narrativa e do julgamento profissional.
Quadro 4. Métricas técnicas e significado institucional
Métrica | Pergunta técnica | Risco se interpretada isoladamente | Uso responsável |
Sensibilidade | Entre casos com desfecho, quantos foram sinalizados? | Pode ser alta com excesso de falsos positivos. | Relacionar ao custo de perder casos graves e à capacidade de resposta. |
Especificidade | Entre casos sem desfecho, quantos foram corretamente não sinalizados? | Pode mascarar baixa detecção de eventos raros. | Analisar junto a sensibilidade e prevalência. |
AUC | O modelo discrimina casos positivos de negativos em diferentes limiares? | Não informa calibração nem consequência de um limiar operacional específico. | Usar como medida de discriminação, não como “percentual de acertos”. |
PPV | Entre os classificados positivos, quantos tiveram o desfecho? | É fortemente dependente da taxa-base e da intervenção. | Interpretar no contexto de prevalência e política de proteção. |
FNR | Qual proporção dos positivos reais foi perdida? | Média global pode esconder subproteção de subgrupos. | Publicar por raça/etnia, território e outros grupos relevantes. |
FPR | Qual proporção dos negativos foi sinalizada? | Pode indicar intervenção excessiva em certos grupos. | Avaliar proporcionalidade e impactos de medidas associadas. |
Calibração | Riscos previstos correspondem às frequências observadas? | Calibração global pode ocultar descalibração por subgrupo. | Verificar curvas e bins por subgrupo e ao longo do tempo. |
Fonte: elaboração própria a partir da literatura e documentos analisados.
7. O CONTEXTO BRASILEIRO: FONAR, FEMINICÍDIO E GOVERNANÇA DE IA
7.1. FONAR e Gestão de Risco
A política brasileira de avaliação de risco em violência doméstica tem como referência o FONAR. A Resolução Conjunta CNJ/CNMP n. 5/2020 instituiu o instrumento para identificar fatores que indiquem risco de nova violência e subsidiar decisões do Ministério Público, do Judiciário e da rede de proteção; a Lei n. 14.149/2021 incorporou o formulário ao ordenamento jurídico e previu aplicação preferencial pela Polícia Civil no registro da ocorrência, ou por Ministério Público e Judiciário quando necessário. O instrumento possui questões objetivas e subjetivas e deve integrar procedimentos relacionados aos casos, preservando sigilo. Em 2025, uma Portaria Conjunta atualizou o modelo e a versão eletrônica foi disponibilizada na Plataforma Digital do Poder Judiciário; em 2026, o CNJ ampliou funcionalidades e acesso off-line.
A digitalização cria uma infraestrutura valiosa para consistência e interoperabilidade, mas não autoriza concluir que o FONAR seja um algoritmo de IA. Um formulário eletrônico pode apenas coletar e organizar dados. Essa distinção é crucial para evitar um debate artificial. O ponto relevante é prospectivo: se, no futuro, dados do FONAR forem usados para treinar modelos preditivos, quais requisitos devem existir? A resposta exige governança antes do desenvolvimento, porque a base contém informações altamente sensíveis sobre violência, saúde, filhos, armas, dependência, ameaças e vulnerabilidades. O uso secundário para modelagem não deve ser tratado como consequência automática da digitalização.
O Guia Interinstitucional de Avaliação de Risco lançado pelo CNJ em 2025 reforça a natureza de gestão integrada do risco e a necessidade de interpretação profissional. Isso oferece uma base institucional compatível com IA assistiva, não substitutiva. Um sistema computacional poderia, por exemplo, verificar campos ausentes, identificar combinações que exigem revisão ou recuperar histórico relevante, desde que essas funções sejam transparentes e não convertam a ausência de dado em ausência de risco. Em domínio tão sensível, a primeira aplicação de IA não deveria ser “decidir quem merece proteção”, mas melhorar qualidade, completude e rastreabilidade do processo humano.
7.2. Raça, Desigualdade e Obrigação de Testar Subgrupos
O debate brasileiro precisa partir da distribuição real da violência. O Fórum Brasileiro de Segurança Pública informou que, em 2024, mulheres negras representaram 63,6% das vítimas de feminicídio. A estatística expressa a interseção entre violência de gênero e desigualdades raciais, embora não explique isoladamente todos os mecanismos causais. Para um sistema de avaliação de risco, entretanto, a implicação é direta: raça/cor não pode aparecer apenas em relatórios descritivos; deve integrar o plano de auditoria de desempenho e equidade. Se o atributo não puder ser usado como preditor por razões normativas ou de minimização, ainda assim pode ser necessário coletá-lo de forma protegida para testes de fairness e detecção de disparidades.
A exclusão de raça do conjunto de variáveis pode produzir a ilusão de neutralidade. Modelos podem inferir padrões associados a raça por meio de território, renda, escolaridade, histórico policial ou acesso a serviços. Ao mesmo tempo, usar raça diretamente para ajustar risco pode criar problemas jurídicos e éticos se não houver finalidade legítima, necessidade e proporcionalidade. A solução não é uma regra universal, e sim governança de atributos sensíveis: definir claramente quais variáveis entram na predição, quais são usadas apenas para auditoria, como proxies são identificados e como resultados por subgrupo são publicados sem expor pessoas.
Também é preciso analisar os registros que antecedem a modelagem. Se mulheres negras encontram mais obstáculos para obter medidas protetivas, registrar stalking ou ser encaminhadas a serviços, o histórico de “intervenção bem-sucedida” pode ser diferente entre grupos. Um algoritmo treinado para reproduzir decisões passadas pode aprender padrões de desigualdade institucional. Por isso, o rótulo ideal não deve ser “decisão que o Estado tomou”, mas um desfecho substantivo que represente risco ou violência, quando disponível e eticamente justificável. Predizer decisões passadas é automatizar a burocracia; predizer risco requer outro desenho.
7.3. Resolução CNJ N. 615/2025, LGPD e Sistemas de Alto Risco
A Resolução CNJ n. 615/2025, com alteração pela Resolução n. 674/2026, estabelece diretrizes para desenvolvimento, uso e governança de IA no Poder Judiciário. O anexo classifica como de alto risco finalidades relacionadas à identificação de perfis e padrões comportamentais, avaliação de meios de prova e interpretação de fatos em matéria criminal. A norma exige salvaguardas, auditorias e relatórios de impacto, além de proibir determinadas aplicações que não permitam supervisão e revisão humana ou que produzam discriminação abusiva. Um sistema que influencie avaliação judicial de risco em violência doméstica se aproximaria, por sua finalidade e consequência, das categorias que demandam o mais alto nível de cautela.
A Lei Geral de Proteção de Dados acrescenta princípios de finalidade, adequação, necessidade, transparência, segurança, prevenção e não discriminação, além de regras específicas para dados pessoais sensíveis. O art. 20 prevê direito de solicitar revisão de decisões tomadas unicamente com base em tratamento automatizado que afetem interesses do titular. Em violência doméstica, a aplicação concreta exige compatibilização com bases legais do poder público, sigilo processual, proteção da vítima e segurança institucional. Mesmo quando uma decisão não for “unicamente automatizada”, o espírito da norma reforça a necessidade de explicação e revisão quando o sistema influencia significativamente o resultado.
A Lei n. 14.994/2024 tornou o feminicídio crime autônomo e elevou a resposta penal, enquanto a Lei n. 14.899/2024 estabeleceu planejamento integrado e mecanismos de monitoramento no enfrentamento à violência doméstica. Em 2026, alterações legislativas ampliaram hipóteses de afastamento do agressor e reforçaram instrumentos de proteção. Esses marcos demonstram que o sistema jurídico brasileiro já trata risco como fenômeno multidimensional que exige articulação entre segurança, Justiça e rede de atendimento. A IA, se utilizada, deve integrar essa política e não substituí-la. Um score não concede abrigo, não fiscaliza medida protetiva, não oferece assistência e não constrói plano de segurança; apenas pode informar uma decisão que continua sendo humana e institucional.
Quadro 5. Marcos brasileiros e europeus relevantes para governança de sistemas de risco
Marco | Objeto | Implicação para IA em violência doméstica |
Lei 11.340/2006 – Maria da Penha | Prevenção, proteção e resposta à violência doméstica e familiar. | Qualquer sistema deve reforçar proteção integral e não reduzir direitos a uma classificação automática. |
Lei 14.149/2021 e FONAR | Avaliação estruturada de fatores de risco. | Base institucional para gestão de risco; digitalização não equivale a IA. |
LGPD – Lei 13.709/2018 | Proteção de dados pessoais e dados sensíveis. | Finalidade, necessidade, não discriminação, segurança e revisão de decisões automatizadas. |
Lei 14.994/2024 | Feminicídio como crime autônomo e agravamento de proteção penal. | Reforça relevância da prevenção, sem converter risco estatístico em certeza jurídica. |
Resolução CNJ 615/2025, alterada pela 674/2026 | Governança de IA no Poder Judiciário. | Classificação de alto risco, auditoria, impacto, não discriminação e supervisão humana. |
Regulamento (UE) 2024/1689 – AI Act | Regulação baseada em risco para IA na União Europeia. | Sistemas de law enforcement e avaliações de risco podem ser de alto risco; exige transparência, qualidade de dados e supervisão. |
Fonte: elaboração própria a partir da literatura e documentos analisados.
8. GOVERNANÇA: DA ACURÁCIA À JUSTIÇA ALGORÍTMICA
Um sistema responsável começa pelo desenho da finalidade. “Prevenir feminicídio” é amplo demais para um modelo. É necessário especificar se a ferramenta pretende detectar registros incompletos, prever revitimização em horizonte definido, estimar violência grave, identificar fatores de letalidade ou priorizar revisão multidisciplinar. Cada objetivo exige dados e métricas diferentes. A finalidade também define o limite: um modelo treinado para revitimização em seis meses não deve ser reutilizado para fundamentar decisão sobre prisão preventiva, guarda de filhos ou credibilidade da vítima sem validação e base jurídica próprias. O reuso funcional é uma das formas mais perigosas de expansão silenciosa de sistemas algorítmicos.
A segunda camada é justiça de dados. Deve existir inventário de fontes, dicionário de variáveis, mapa de missingness, análise de quem está ausente, rastreabilidade de mudanças e documentação de rótulos. Dados de violência doméstica não podem ser considerados “ground truth” apenas porque são oficiais. A base deve ser tratada como produto de práticas de denúncia e registro. Auditorias precisam comparar frequência de campos, qualidade narrativa e taxas de ausência por território e subgrupo. Quando a qualidade é muito desigual, o correto pode ser limitar escopo ou suspender uso preditivo.
A terceira camada é validação estatística e fairness. Além de AUC, sensibilidade, especificidade e calibração, o relatório deve apresentar matriz de confusão por raça/etnia, idade, região e outros grupos relevantes. Deve testar estabilidade temporal e desempenho em unidades policiais ou tribunais distintos. Diferenças significativas exigem investigação causal antes da implantação. Um sistema não deve ser considerado adequado apenas porque todos os grupos melhoram em relação a um baseline fraco; é preciso perguntar se o nível absoluto de subproteção é aceitável e se a política pública dispõe de meios para corrigi-lo.
A quarta camada é supervisão humana significativa. O profissional deve visualizar fatores relevantes, grau de incerteza e histórico de reavaliações. Overrides devem ser permitidos nos dois sentidos quando juridicamente cabíveis, mas precisam de justificativa documentada e monitoramento. Padrões de override podem revelar falhas do modelo, necessidade de treinamento ou vieses humanos. A supervisão não deve ser desenhada como um ritual de confirmação do sistema; deve produzir evidência de que o julgamento contextual tem capacidade real de modificar o fluxo.
A quinta camada é proporcionalidade da intervenção. Um score não deve acionar automaticamente a medida mais intrusiva. A resposta deve considerar vontade e segurança da vítima, risco para filhos, disponibilidade de serviços, medidas protetivas, acompanhamento do agressor e contexto local. Em alguns casos, a principal necessidade será proteção física imediata; em outros, apoio econômico, abrigo, monitoramento de descumprimento ou segurança digital. Sistemas algorítmicos devem funcionar dentro de uma arquitetura de opções, não como mecanismo binário “proteger/não proteger”.
A sexta camada é contestabilidade e transparência. Transparência não exige publicar dados pessoais nem necessariamente todo o código-fonte, mas exige documentação suficiente para que especialistas independentes possam compreender finalidade, variáveis, dados de treinamento, métricas, limitações e mudança de versões. Pessoas afetadas devem saber que uma ferramenta foi usada e ter meio de corrigir informações factualmente erradas. Órgãos de controle precisam ter acesso para auditoria, inclusive sobre fornecedores privados. A opacidade é especialmente problemática quando a classificação influencia prioridade policial ou proteção judicial.
A sétima camada é monitoramento pós-implantação. Modelos podem degradar com drift, mudança de legislação, novas práticas de registro ou alteração do perfil de casos. A auditoria deve ser contínua, com revisões após eventos graves, análise de falsos negativos e de divergências humanas. Um feminicídio ocorrido após classificação de baixo risco não prova, isoladamente, falha do algoritmo; contudo, exige revisão sistêmica de dados, aplicação, contexto e resposta institucional. Accountability significa investigar a cadeia inteira, não atribuir responsabilidade a um score.
Quadro 6. Matriz JAPI-Fem: Justiça Algorítmica para Prevenção Interseccional do Feminicídio
Dimensão | Pergunta de governança | Requisito mínimo | Indicador de auditoria |
J – Justiça de dados | Quem está representado, ausente ou mal medido? | Proveniência, dicionário, missingness e análise de representatividade. | Taxa de ausência e qualidade por subgrupo/território. |
A – Avaliação por subgrupos | O desempenho é semelhante onde o dano social é desigual? | Sensibilidade, FNR, FPR e calibração por grupos relevantes. | Relatório público de fairness com intervalos de confiança. |
P – Proporcionalidade | O escore aciona respostas compatíveis com risco e direitos? | Vincular categorias a opções graduais e revisão contextual. | Frequência de intervenções e efeitos adversos por nível. |
I – Intervenção humana | Profissionais conseguem discordar de modo real e informado? | Explicação, override, justificativa e treinamento. | Taxa e direção de overrides; concordância excessiva. |
F – Feedback e revisão | O sistema aprende com erros e mudanças do contexto? | Monitoramento de drift, eventos graves e revalidação periódica. | Desempenho temporal, incidentes e versão do modelo. |
E – Explicabilidade e contestação | A pessoa afetada e o controle externo compreendem o uso? | Aviso de uso, correção de dados e documentação auditável. | Pedidos de revisão, correções e auditorias independentes. |
M – Minimização e segurança | São processados apenas dados necessários e protegidos? | Controle de acesso, logs, minimização e segurança. | Incidentes, acessos indevidos e revisão de finalidade. |
Fonte: elaboração própria a partir da literatura e documentos analisados.
9. RESULTADOS E DISCUSSÃO
A síntese demonstra uma tensão central: quanto maior a promessa de precisão algorítmica, maior a necessidade de situar o modelo dentro de um sistema sociotécnico. A evidência é suficiente para afirmar que técnicas de machine learning conseguem extrair padrões úteis de registros de violência doméstica e, em alguns conjuntos de dados, superar instrumentos ou classificações humanas tradicionais em medidas de discriminação. Não é suficiente, porém, para concluir que IA prevê feminicídio de modo confiável ou que sua adoção reduz mortes. Entre capacidade preditiva e resultado preventivo existe uma cadeia de ações: registro, interpretação, alerta, decisão, proteção, acompanhamento e resposta à mudança do risco. A falha em qualquer elo pode neutralizar o melhor modelo.
O segundo resultado é que justiça algorítmica não pode ser tratada como auditoria posterior. Vieses entram antes da modelagem, quando algumas vítimas aparecem menos nos dados, quando variáveis são preenchidas de forma inconsistente e quando o desfecho escolhido representa comportamento institucional em vez de violência. Selbst et al. (2019) alertam para o “problema de abstração”: modelos formalizam uma parte de um sistema social e podem apagar elementos essenciais do contexto. Em violência doméstica, coerção, medo, dependência e isolamento são difíceis de reduzir a campos binários. Machine learning pode ajudar a recuperar sinais, mas não transforma dados parciais em verdade completa.
O terceiro resultado diz respeito à raça e à interseccionalidade. O estudo britânico de Turner et al. (2022) comprova empiricamente que disparidades de desempenho podem ser medidas em subgrupos étnicos e socioeconômicos; o estudo de Martínez Garay et al. (2025) levanta preocupação de discriminação indireta no VioGén para mulheres nascidas fora da Espanha. No Brasil, a predominância de mulheres negras entre vítimas de feminicídio torna essa agenda inevitável. Ainda não há, nas fontes analisadas, evidência pública de um sistema nacional brasileiro de IA que já atribua score de feminicídio com base no FONAR. Por isso, o artigo não atribui ao Brasil um viés algorítmico já demonstrado; identifica, sim, uma obrigação de prevenção de discriminação antes de qualquer implantação.
O quarto resultado é que métricas de fairness devem ser vinculadas ao dano. Em um contexto de proteção, igualdade de falso negativo pode ser mais importante que igualdade de falso positivo, mas não pode ser escolhida sem analisar consequências para medidas restritivas. Chouldechova (2017) e Kleinberg, Mullainathan e Raghavan (2017) mostram que certos critérios de equidade não podem ser simultaneamente satisfeitos quando prevalências diferem. Isso transforma fairness em decisão normativa, e não apenas de engenharia. A política deve declarar quais erros considera mais graves, quais limites aceita e como compensa grupos que enfrentam riscos desiguais.
O quinto resultado é a centralidade da supervisão humana. A experiência do VioGén mostra que possibilidade formal de override não basta. Quando profissionais aderem quase automaticamente ao resultado, a decisão torna-se, na prática, automatizada. A Resolução CNJ n. 615/2025 e o AI Act europeu caminham na direção correta ao exigir governança, supervisão, transparência e controle de risco. Contudo, tais princípios precisam ser materializados em interfaces, treinamento, auditoria de comportamento dos operadores e mecanismos de revisão. A qualidade da interação humano-algoritmo é parte do desempenho do sistema.
Por fim, a análise sugere que o melhor uso inicial de IA no campo brasileiro pode estar em tarefas de apoio de menor risco decisório: detecção de inconsistências, recuperação de histórico, sumarização rastreável, alertas sobre campos críticos ausentes e apoio à reavaliação periódica. A automatização direta de categorias de proteção deveria exigir evidência muito mais robusta, avaliação de impacto em direitos fundamentais, validação independente e experimentação controlada. A tecnologia deve aumentar a capacidade institucional de ver sinais que hoje estão dispersos, e não produzir uma nova autoridade opaca que substitua a escuta da vítima.
10. CONSIDERAÇÕES FINAIS
A prevenção do feminicídio é um domínio em que a promessa de inteligência artificial precisa ser submetida a um padrão particularmente elevado de evidência e responsabilidade. Sistemas de avaliação de risco podem contribuir para tornar visíveis padrões que escapam à análise individual, sobretudo quando registros são volumosos e fragmentados. Estudos com VioGén, dados policiais britânicos e modelos recentes demonstram que técnicas estatísticas e de machine learning podem oferecer discriminação preditiva útil em determinados contextos. Entretanto, a literatura disponível não autoriza converter essa capacidade em narrativa de “previsão do feminicídio”. O desfecho letal é raro, contextual e influenciado por intervenções. A formulação cientificamente mais adequada é que algoritmos podem apoiar reconhecimento e priorização de risco, desde que integrados a avaliação humana, redes de proteção e processos institucionais capazes de agir.
A principal ameaça à legitimidade desses sistemas não é apenas o erro técnico, mas a distribuição desigual do erro. Um modelo pode apresentar boa AUC global e ainda deixar grupos específicos com maior taxa de falso negativo. Em um país no qual mulheres negras estão sobrerrepresentadas entre vítimas de feminicídio, a ausência de auditoria racial seria metodologicamente insuficiente e eticamente incompatível com uma política de prevenção. Justiça algorítmica exige perguntar quem fica invisível, quem recebe proteção menor, quais dados estão ausentes e quais proxies reproduzem desigualdades históricas. A neutralidade não se obtém removendo raça da tabela; ela depende de entender como raça e outras posições sociais moldam exposição à violência e contato com instituições.
O artigo também mostrou que gênero não pode ser tratado como variável ornamental. Instrumentos de violência por parceiro íntimo foram desenvolvidos em contextos específicos e incorporam conceitos como coerção, ameaça, escalada, armas e separação. Modelos que buscam maior precisão a partir de históricos administrativos correm o risco de reduzir o fenômeno ao que é mais fácil registrar: antecedentes, chamadas e ocorrências. A consequência pode ser uma perda de sensibilidade para violência psicológica, stalking e mudanças qualitativas na relação. A solução não é rejeitar dados históricos, mas combiná-los com fatores clinicamente e criminologicamente relevantes e preservar espaço para narrativas que o banco de dados não consegue representar.
No plano decisório, a distinção entre apoio e substituição é fundamental. Supervisão humana significativa significa poder discordar, justificar e revisar; não significa apenas clicar em “confirmar” após receber um score. Interfaces devem apresentar incerteza, fatores principais e histórico do risco. Instituições devem auditar a frequência de override e investigar tanto concordância excessiva quanto divergências sistemáticas. A vítima deve ter oportunidade de corrigir informações e adicionar contexto, sem assumir o ônus de demonstrar que uma máquina errou. A responsabilidade final permanece com o Estado e seus agentes, não com o fornecedor nem com o algoritmo.
No Brasil, o FONAR oferece uma base normativa e operacional para gestão estruturada de risco. Sua evolução digital pode melhorar interoperabilidade e consistência, mas deve permanecer conceitualmente separada de IA até que exista uma função preditiva efetivamente implementada e documentada. Qualquer projeto futuro de machine learning com dados do FONAR ou de sistemas policiais e judiciais deveria ser precedido por avaliação de impacto em direitos fundamentais e proteção de dados, plano de fairness por subgrupo, governança de atributos sensíveis, validação externa e protocolo explícito de uso. A Resolução CNJ n. 615/2025 já fornece elementos relevantes para esse desenho, especialmente na classificação de sistemas de alto risco, auditoria, não discriminação e revisão humana.
A Matriz JAPI-Fem proposta sintetiza essa agenda em sete dimensões: justiça de dados, avaliação por subgrupos, proporcionalidade, intervenção humana, feedback, explicabilidade/contestação e minimização/segurança. Ela não pretende funcionar como instrumento clínico ou policial, nem produzir score. Seu objetivo é servir como quadro de governança para pesquisadores, tribunais, polícias e gestores que avaliem soluções algorítmicas nesse domínio. Um sistema só deveria avançar da fase experimental para uso decisório quando demonstrasse, simultaneamente, utilidade incremental, estabilidade, segurança, equidade e capacidade de ser contestado.
Pesquisas futuras precisam priorizar validação prospectiva e independente em cenários reais. Estudos devem reportar não apenas AUC, mas calibração, intervalos de confiança, false negative rate, false positive rate e desempenho em subgrupos interseccionais. Também devem avaliar efeitos sobre comportamento dos profissionais: um sistema pode ser tecnicamente bom e produzir pior resultado se gerar complacência. A incorporação de relatos de sobreviventes e organizações especializadas é igualmente necessária para identificar danos que não aparecem em bases administrativas, inclusive medo de denunciar, perda de autonomia e efeitos de intervenções indesejadas.
Em síntese, a questão normativa não é escolher entre “algoritmo” e “humano”. Decisões humanas também são sujeitas a preconceitos, inconsistências e limitações de memória; algoritmos podem tornar critérios visíveis e auditáveis. O objetivo é construir arranjos em que as forças de cada componente corrijam as fragilidades do outro. A IA pode ampliar a capacidade de identificar sinais, mas não deve definir sozinha quem está em perigo, quem merece proteção ou qual medida deve ser aplicada. Na prevenção do feminicídio, justiça algorítmica significa transformar desempenho técnico em proteção efetiva sem sacrificar igualdade, dignidade, devido processo, autonomia da vítima e responsabilidade pública.
REFERÊNCIAS BIBLIOGRÁFICAS
BAILO, P.; NITTARI, G.; SPASARI, T.; GIBELLI, F.; RICCI, G. Artificial intelligence in intimate partner violence risk pathways: a PRISMA-ScR review of femicide prevention and medico-legal accountability. Frontiers in Digital Health, v. 8, 2026, art. 1877651. DOI: 10.3389/fdgth.2026.1877651.
BERK, R. A.; SORENSON, S. B.; BARNES, G. Forecasting domestic violence: a machine learning approach to help inform arraignment decisions. Journal of Empirical Legal Studies, v. 13, n. 1, p. 94-115, 2016. DOI: 10.1111/jels.12098.
BRASIL. Lei n. 11.340, de 7 de agosto de 2006. Cria mecanismos para coibir a violência doméstica e familiar contra a mulher. Brasília, DF: Presidência da República, 2006.
BRASIL. Lei n. 13.709, de 14 de agosto de 2018. Lei Geral de Proteção de Dados Pessoais (LGPD). Brasília, DF: Presidência da República, 2018.
BRASIL. Lei n. 14.149, de 5 de maio de 2021. Institui o Formulário Nacional de Avaliação de Risco, a ser aplicado à mulher vítima de violência doméstica e familiar. Brasília, DF: Presidência da República, 2021.
BRASIL. Lei n. 14.899, de 17 de junho de 2024. Dispõe sobre plano de metas para o enfrentamento integrado da violência doméstica e familiar contra a mulher. Brasília, DF: Presidência da República, 2024.
BRASIL. Lei n. 14.994, de 9 de outubro de 2024. Torna o feminicídio crime autônomo e estabelece outras medidas de prevenção e repressão à violência contra a mulher. Brasília, DF: Presidência da República, 2024.
CAMPBELL, J. C.; WEBSTER, D. W.; GLASS, N. The Danger Assessment: validation of a lethality risk assessment instrument for intimate partner femicide. Journal of Interpersonal Violence, v. 24, n. 4, p. 653-674, 2009. DOI: 10.1177/0886260508317180.
CHOULDECHOVA, A. Fair prediction with disparate impact: a study of bias in recidivism prediction instruments. Big Data, v. 5, n. 2, p. 153-163, 2017. DOI: 10.1089/big.2016.0047.
CONSELHO NACIONAL DE JUSTIÇA; CONSELHO NACIONAL DO MINISTÉRIO PÚBLICO. Portaria Conjunta n. 6, de 25 de julho de 2025. Altera o modelo do Formulário Nacional de Avaliação de Risco. Brasília, 2025.
CONSELHO NACIONAL DE JUSTIÇA; CONSELHO NACIONAL DO MINISTÉRIO PÚBLICO. Resolução Conjunta n. 5, de 3 de março de 2020. Institui o Formulário Nacional de Avaliação de Risco no âmbito do Poder Judiciário e do Ministério Público. Brasília, 2020.
CONSELHO NACIONAL DE JUSTIÇA. Resolução n. 615, de 11 de março de 2025. Estabelece diretrizes para o desenvolvimento, utilização e governança de soluções desenvolvidas com recursos de inteligência artificial no Poder Judiciário. Brasília, 2025. Texto compilado com a Resolução n. 674/2026.
ETICAS FOUNDATION. The External Audit of the VioGén System. Barcelona: Eticas Foundation, 2022.
EUROPEAN DATA PROTECTION SUPERVISOR. TechDispatch #2/2025: Human Oversight of Automated Decision-Making. Brussels: EDPS, 2025.
EUROPEAN UNION. Regulation (EU) 2024/1689 of the European Parliament and of the Council of 13 June 2024 laying down harmonised rules on artificial intelligence (Artificial Intelligence Act). Official Journal of the European Union, 2024.
FÓRUM BRASILEIRO DE SEGURANÇA PÚBLICA. Anuário Brasileiro de Segurança Pública 2025. São Paulo: FBSP, 2025.
GARCIA-VERGARA, E.; ALMEDA, N.; FERNÁNDEZ-NAVARRO, F.; BECERRA-ALONSO, D. Risk Assessment Instruments for Intimate Partner Femicide: A Systematic Review. Frontiers in Psychology, v. 13, 2022, art. 896901. DOI: 10.3389/fpsyg.2022.896901.
GONZÁLEZ-PRIETO, Á.; BRÚ, A.; NUÑO, J. C.; GONZÁLEZ-ÁLVAREZ, J. L. Hybrid machine learning methods for risk assessment in gender-based crime. Knowledge-Based Systems, v. 260, 2023, art. 110130. DOI: 10.1016/j.knosys.2022.110130.
GRAHAM, L. M.; SAHAY, K. M.; RIZO, C. F.; MESSING, J. T.; MACY, R. J. The validity and reliability of available intimate partner homicide and reassault risk assessment tools: a systematic review. Trauma, Violence, & Abuse, v. 22, n. 1, p. 18-40, 2021. DOI: 10.1177/1524838018821952.
KARISTIANIS, G.; CABRAL, R. C.; ADILY, A.; LUKMANJAYA, W.; SCHOFIELD, P.; BUCHAN, I. et al. Utilizing text mining, data linkage and deep learning in police and health records to predict future offenses in family and domestic violence. Frontiers in Digital Health, v. 3, 2021, art. 602683. DOI: 10.3389/fdgth.2021.602683.
KLEINBERG, J.; MULLAINATHAN, S.; RAGHAVAN, M. Inherent trade-offs in the fair determination of risk scores. In: ITCS 2017 – Innovations in Theoretical Computer Science Conference. LIPIcs, v. 67, 2017, art. 43. DOI: 10.4230/LIPIcs.ITCS.2017.43.
LÓPEZ-OSSORIO, J. J.; GONZÁLEZ-ÁLVAREZ, J. L.; ANDRÉS-PUEYO, A. Eficacia predictiva de la valoración policial del riesgo de la violencia de género. Psychosocial Intervention, v. 25, n. 1, p. 1-7, 2016. DOI: 10.1016/j.psi.2015.10.002.
LÓPEZ-OSSORIO, J. J.; GONZÁLEZ-ÁLVAREZ, J. L.; LOINAZ, I.; MARTÍNEZ-MARTÍNEZ, A.; PINEDA, D. Intimate partner homicide risk assessment by police in Spain: the dual protocol VPR5.0-H. Psychosocial Intervention, v. 30, n. 1, p. 47-55, 2021. DOI: 10.5093/pi2020a16.
MARTÍNEZ GARAY, L.; GARCÍA ORTIZ, A. M.; MOLINA SÁNCHEZ, M.; PERIS MANGUILLOT, A. El uso de las valoraciones de riesgo hechas con algoritmos e inteligencia artificial para el diseño de las políticas públicas: posible discriminación indirecta de mujeres nacidas fuera de España en el sistema VioGén. ReCRIM, n. extra 25, p. 139-161, 2025.
MINISTERIO DEL INTERIOR DE ESPAÑA. Interior diseña un nuevo modelo de respuesta policial a la violencia de género: Sistema VioGén 2 y Protocolo 2025. Madrid, 2025.
SELbst, A. D.; BOYD, D.; FRIEDLER, S. A.; VENKATASUBRAMANIAN, S.; VERTESI, J. Fairness and abstraction in sociotechnical systems. In: Proceedings of the Conference on Fairness, Accountability, and Transparency. New York: ACM, 2019. p. 59-68. DOI: 10.1145/3287560.3287598.
SURESH, H.; GUTTAG, J. A framework for understanding sources of harm throughout the machine learning life cycle. In: Proceedings of the 2021 ACM Conference on Equity and Access in Algorithms, Mechanisms, and Optimization. New York: ACM, 2021. DOI: 10.1145/3465416.3483305.
TURNER, E.; BROWN, G.; MEDINA-ARIZA, J. Predicting Domestic Abuse (Fairly) and Police Risk Assessment. Psychosocial Intervention, v. 31, n. 3, p. 145-157, 2022. DOI: 10.5093/pi2022a11.
VERREY, J.; ARIEL, B.; HARINAM, V.; DILLON, L. Using machine learning to forecast domestic homicide via police data and super learning. Scientific Reports, v. 13, 2023, art. 22932. DOI: 10.1038/s41598-023-50274-2.
1 Universidade do Estado do Amazonas (UEA). Manaus, Amazonas, Brasil. Mestrando. ORCID: https://orcid.org/0009-0000-7570-553X. Lattes: http://lattes.cnpq.br/7119459369582263. E-mail: [clique para visualizar o e-mail]acesse o artigo original para visualizar o e-mail
2 Universidade do Estado do Amazonas (UEA). Manaus, Amazonas, Brasil. Mestranda. ORCID: https://orcid.org/0009-0002-4567-2719. Lattes: http://lattes.cnpq.br/8273109846633134. E-mail: [clique para visualizar o e-mail]acesse o artigo original para visualizar o e-mail
3 Universidade do Estado do Amazonas (UEA). Manaus, Amazonas, Brasil. Mestranda. ORCID: https://orcid.org/0009-0003-0438-1381. Lattes: http://lattes.cnpq.br/8596584203898728. E-mail: [clique para visualizar o e-mail]acesse o artigo original para visualizar o e-mail
4 Universidade do Estado do Amazonas (UEA). Manaus, Amazonas, Brasil. Mestranda. ORCID: https://orcid.org/0009-0006-9380-8384. Lattes: http://lattes.cnpq.br/6718522744209371. E-mail: [clique para visualizar o e-mail]acesse o artigo original para visualizar o e-mail
5 UEA. Manaus, Amazonas, Brasil. Especialista. ORCID: https://orcid.org/0009-0004-0088-8000. Lattes: http://lattes.cnpq.br/2968031807911939. E-mail: [clique para visualizar o e-mail]acesse o artigo original para visualizar o e-mail