CX para SaaS · 5 min
A NVIDIA tem 19 bases de dados chamadas Nemotron. Só uma serve para simular cliente brasileiro
A família Nemotron da NVIDIA tem 19 datasets sob nomes parecidos e licenças muito diferentes. Um mapeamento de qual serve para uso editorial e qual só treina modelo.
Por Diogo Kammers · 16/09/2026
Um nome, 19 bases diferentes
Quando alguém cita "o dataset Nemotron da NVIDIA", a frase esconde uma confusão real: existem pelo menos 19 conjuntos de dados publicados sob esse nome, agrupados em famílias distintas, e a diferença entre eles não é só de conteúdo. É de licença. Nem todo Nemotron pode ser usado do mesmo jeito.
Esse mapeamento cobre as seis famílias publicadas até 16/09/2026 (data de acesso de todas as fontes citadas abaixo): Personas (10 países), CC (pré-treino web), Pretraining (SFT/pré-treino especializado), Post-Training (ajuste fino), Reward/HelpSteer (preferência humana) e Safety (segurança de conteúdo).
A distinção que importa: as duas licenças que parecem iguais
A maioria dos datasets Nemotron cai em duas famílias de licença, e confundir uma com a outra é o erro mais caro de se cometer antes de publicar qualquer coisa a partir deles.
CC BY 4.0 (Creative Commons Atribuição 4.0) permite uso comercial, redistribuição, modificação e obra derivada, exigindo só atribuição ao criador. É a licença de toda a família Personas (10 países), de toda a família HelpSteer (3 versões) e das duas bases de segurança de conteúdo (Safety-Guard-Dataset-v3 e Content-Safety-Reasoning-Dataset). Essa é a licença que permite extrair estatística, publicar análise e usar como insumo editorial, não só treinar modelo.
NVIDIA Data Access Agreement for Model Training é outra história. O texto da licença, lido direto no documento oficial, diz que a empresa não pode "vender, alugar, sublicenciar, transferir, distribuir, exibir publicamente ou de qualquer forma disponibilizar a outros os Datasets". Essa licença cobre os datasets de pré-treino web puro (Nemotron-CC, Nemotron-Pretraining-Dataset-sample, Nemotron-Pretraining-Code-v1): eles servem só para uma empresa treinar seu próprio modelo internamente, nunca para publicar trecho ou estatística extraída deles.
As 19 bases, por família
Personas (10 países, CC BY 4.0): Brasil, EUA, Japão, Índia, Singapura, França, Coreia, El Salvador, Vietnã e Bélgica. O Brasil é a única com schema lido campo a campo por amostra real: 1 milhão de personas sintéticas ancoradas em idade, sexo, escolaridade, ocupação e município do IBGE, geradas pelo NeMo Data Designer em parceria com a WideLabs. A Índia é a maior da família, com 21 milhões de personas trilíngues.
CC e Pretraining (pré-treino, licença restrita): Nemotron-CC-v2, Nemotron-CC-v2.1 (2,5 trilhões de tokens novos em inglês), Nemotron-CC-Math-v1, Nemotron-CC-Code-v1, Nemotron-Pretraining-Dataset-sample e Nemotron-Pretraining-Code-v1. A exceção dentro dessa família é o Nemotron-Pretraining-Specialized-v1, majoritariamente CC BY 4.0 (com dois subconjuntos internos em licença mais restrita, CC BY-SA e GFDL).
Post-Training: Nemotron-Post-Training-Dataset-v2, 7,3 milhões de amostras de ajuste fino em 6 idiomas, CC BY 4.0 com exceções pontuais (um subconjunto vindo do Stack Overflow herda CC BY-SA, que exige que qualquer obra derivada publicada use a mesma licença).
Reward e HelpSteer: HelpSteer, HelpSteer2 e HelpSteer3, as três CC BY 4.0. A terceira versão tem 132.937 linhas anotadas por cerca de 7.000 pessoas via Scale AI e Translated, com pelo menos 3 avaliadores independentes por amostra, medindo o que torna uma resposta de IA útil, coerente e correta.
Safety: Nemotron-Safety-Guard-Dataset-v3 (514.617 linhas, 12 idiomas, CC BY 4.0) e Nemotron-Content-Safety-Reasoning-Dataset (CC BY 4.0) classificam conteúdo em categorias de risco. O Nemotron-3.5-Content-Safety-Dataset e o Nemotron-AIQ-Agentic-Safety-Dataset-1.0 completam a família, o segundo sob licença proprietária de avaliação, não aberta.
O que a DNACX já usa, e por quê
Este site usa o Nemotron-Personas-Brazil em duas superfícies: as páginas municipais de /geo-cx-municipal (distribuição de escolaridade e ocupação por cidade) e o gerador de hipótese de reação de cliente em /persona-cx, sempre rotulado como dado sintético, nunca como medição real. É o único dataset da família com schema confirmado campo a campo nesta análise, e a única aplicação já em produção.
Para quem quer usar um Nemotron além do Brasil
A regra prática: se o dataset está sob CC BY 4.0, dá para citar estatística e publicar análise, com atribuição. Se está sob a licença de acesso a dados da NVIDIA, ele serve só para treinar modelo, nunca para republicar. Confirmar a licença específica de cada dataset antes de usar continua sendo necessário: mesmo dentro de famílias majoritariamente CC BY 4.0 existem exceções internas, subconjunto por subconjunto.
Esse artigo faz parte do hub CX para SaaS.