Diogo Kammers

CX para SaaS · 5 min

Três empresas, três definições diferentes de "persona sintética"

NVIDIA, MatrAIx e Google publicaram datasets abertos que todos chamam de "persona sintética". Nenhum dos três descreve a mesma coisa: um é distribuição demográfica, outro é schema de 1.290 campos, o terceiro é um diálogo entre dois perfis fictícios.

Por Diogo Kammers · 17/09/2026

O mesmo nome, três produtos diferentes

"Persona sintética" virou um termo guarda-chuva. Três organizações publicaram dataset aberto com esse rótulo, e um exame direto mostra que elas não estão descrevendo a mesma coisa. Isso importa na prática: escolher a base errada para o problema errado é o erro mais comum de quem tenta simular cliente com IA.

Nemotron-Personas-Brazil (NVIDIA): distribuição demográfica

Um milhão de registros, cada um com idade, escolaridade, ocupação e município ancorados em dado real do IBGE. O texto narrativo (persona, subpersonas profissional/esportiva/artística) é gerado por LLM, mas a distribuição estatística por trás é calibrada contra censo oficial. Serve para responder "que perfil demográfico plausível existe neste município", não para simular uma conversa. É o único dos três que este site já usa em produção, em /geo-cx-municipal e no gerador de hipótese de reação de cliente. Licença CC BY 4.0.

MatrAIx-Persona-8B: schema de perfil, não uma base de pessoas

Aqui "persona" significa outra coisa: um schema de 1.290 campos categóricos (idade, personalidade, habilidade técnica, hobbies, entre outros) que descreve um indivíduo com detalhe extremo. O dataset restrito por trás desse schema (licença research-only, fora de uso comercial) gera 1 milhão de perfis preenchidos parcialmente nesses 1.290 campos. Como já mostrado neste site, só 26% dessas dimensões tocam algo parecido com comportamento, e o resto é contexto. Não é uma base de pessoas reais nem sintéticas prontas para uso comercial: é uma taxonomia de campos, e é só essa taxonomia (nunca o dataset) que a DNACX usa, no Gerador de Perfil de Comprador B2B e no Simulador de Objeção de Vendas.

Synthetic-Persona-Chat (Google): duas personas e uma conversa

O terceiro sentido é o mais diferente dos três. Aqui uma "persona" é um punhado de frases curtas e casuais ("jogo videogame o dia todo", "tenho faixa preta de karatê"), e o dataset entrega, para cada par de personas, uma conversa completa e natural entre elas. Não há calibração demográfica nenhuma: as personas são inventadas, sem ancoragem em censo ou pesquisa real, e o conteúdo é conversa social genérica, não atendimento. O valor do dataset está no PAR persona-mais-diálogo, útil para quem treina um chatbot a manter consistência de personagem ao longo de uma conversa, não para quem quer saber a distribuição demográfica de um público. Licença CC BY 4.0, sem nenhuma restrição adicional. É a mais permissiva dos três.

Lado a lado

Nemotron-Personas-BrazilMatrAIx-Persona-8BSynthetic-Persona-Chat
O que descreveDistribuição demográfica de uma populaçãoSchema de campos de um indivíduoPar de personas e uma conversa entre elas
Ancoragem em dado realSim, censo do IBGEParcial, por categoriaNenhuma
Formato de saídaRegistro tabular por pessoa1.290 campos categóricos por perfilTexto de diálogo
LicençaCC BY 4.0Research-only (dataset); schema é livreCC BY 4.0
Uso já validado pela DNACXProdução (/geo-cx-municipal, /gerador-persona-cx)Só a taxonomia de campos (nunca o dataset)Nenhum ainda

Por que a confusão custa caro

Usar o dataset errado para a pergunta certa produz erro sutil, não erro óbvio. Pedir distribuição demográfica ao Synthetic-Persona-Chat não funciona, porque ele não tem nenhuma. Pedir uma conversa fluida ao Nemotron-Personas-Brazil também não funciona, porque ele não gera diálogo. E tratar o MatrAIx-Persona-8B como se fosse uma base de pessoas prontas ignora que o dataset em si tem licença que proíbe uso comercial. Só o desenho dos 1.290 campos é livre para reaproveitar.

A pergunta que decide qual dos três serve não é "qual tem mais dado", é "o que eu preciso simular: uma população, um indivíduo detalhado, ou uma conversa".

Quero aplicar isso na minha operação

Esse artigo faz parte do hub CX para SaaS.

FAQ

Perguntas frequentes

Algum desses três datasets serve para simular um cliente real da minha empresa?

Nenhum dos três foi calibrado contra dado de cliente de uma empresa específica. O Nemotron-Personas-Brazil chega mais perto de um contexto demográfico real (censo do IBGE), mas ainda descreve a população geral, não os clientes de um negócio específico.

Por que o MatrAIx aparece na tabela se o dataset dele não pode ser usado comercialmente?

Porque a distinção entre o schema (a estrutura de 1.290 campos, de uso livre) e o dataset preenchido com esse schema (licença research-only) é exatamente o ponto da comparação: mesmo nome, "persona sintética", cobrindo coisas com regras de uso muito diferentes.

O Synthetic-Persona-Chat do Google tem alguma aplicação para atendimento ao cliente?

Não diretamente: é conversa social genérica (hobbies, família, trabalho), sem foco em atendimento. O valor dele está no formato (par de persona mais diálogo consistente), não no conteúdo, para quem constrói um assistente que precisa manter personagem ao longo de uma conversa longa.