Diogo Kammers

CX para SaaS · 5 min

A NVIDIA tem 19 bases de dados chamadas Nemotron. Só uma serve para simular cliente brasileiro

A família Nemotron da NVIDIA tem 19 datasets sob nomes parecidos e licenças muito diferentes. Um mapeamento de qual serve para uso editorial e qual só treina modelo.

Por Diogo Kammers · 16/09/2026

Um nome, 19 bases diferentes

Quando alguém cita "o dataset Nemotron da NVIDIA", a frase esconde uma confusão real: existem pelo menos 19 conjuntos de dados publicados sob esse nome, agrupados em famílias distintas, e a diferença entre eles não é só de conteúdo. É de licença. Nem todo Nemotron pode ser usado do mesmo jeito.

Esse mapeamento cobre as seis famílias publicadas até 16/09/2026 (data de acesso de todas as fontes citadas abaixo): Personas (10 países), CC (pré-treino web), Pretraining (SFT/pré-treino especializado), Post-Training (ajuste fino), Reward/HelpSteer (preferência humana) e Safety (segurança de conteúdo).

A distinção que importa: as duas licenças que parecem iguais

A maioria dos datasets Nemotron cai em duas famílias de licença, e confundir uma com a outra é o erro mais caro de se cometer antes de publicar qualquer coisa a partir deles.

CC BY 4.0 (Creative Commons Atribuição 4.0) permite uso comercial, redistribuição, modificação e obra derivada, exigindo só atribuição ao criador. É a licença de toda a família Personas (10 países), de toda a família HelpSteer (3 versões) e das duas bases de segurança de conteúdo (Safety-Guard-Dataset-v3 e Content-Safety-Reasoning-Dataset). Essa é a licença que permite extrair estatística, publicar análise e usar como insumo editorial, não só treinar modelo.

NVIDIA Data Access Agreement for Model Training é outra história. O texto da licença, lido direto no documento oficial, diz que a empresa não pode "vender, alugar, sublicenciar, transferir, distribuir, exibir publicamente ou de qualquer forma disponibilizar a outros os Datasets". Essa licença cobre os datasets de pré-treino web puro (Nemotron-CC, Nemotron-Pretraining-Dataset-sample, Nemotron-Pretraining-Code-v1): eles servem só para uma empresa treinar seu próprio modelo internamente, nunca para publicar trecho ou estatística extraída deles.

As 19 bases, por família

Personas (10 países, CC BY 4.0): Brasil, EUA, Japão, Índia, Singapura, França, Coreia, El Salvador, Vietnã e Bélgica. O Brasil é a única com schema lido campo a campo por amostra real: 1 milhão de personas sintéticas ancoradas em idade, sexo, escolaridade, ocupação e município do IBGE, geradas pelo NeMo Data Designer em parceria com a WideLabs. A Índia é a maior da família, com 21 milhões de personas trilíngues.

CC e Pretraining (pré-treino, licença restrita): Nemotron-CC-v2, Nemotron-CC-v2.1 (2,5 trilhões de tokens novos em inglês), Nemotron-CC-Math-v1, Nemotron-CC-Code-v1, Nemotron-Pretraining-Dataset-sample e Nemotron-Pretraining-Code-v1. A exceção dentro dessa família é o Nemotron-Pretraining-Specialized-v1, majoritariamente CC BY 4.0 (com dois subconjuntos internos em licença mais restrita, CC BY-SA e GFDL).

Post-Training: Nemotron-Post-Training-Dataset-v2, 7,3 milhões de amostras de ajuste fino em 6 idiomas, CC BY 4.0 com exceções pontuais (um subconjunto vindo do Stack Overflow herda CC BY-SA, que exige que qualquer obra derivada publicada use a mesma licença).

Reward e HelpSteer: HelpSteer, HelpSteer2 e HelpSteer3, as três CC BY 4.0. A terceira versão tem 132.937 linhas anotadas por cerca de 7.000 pessoas via Scale AI e Translated, com pelo menos 3 avaliadores independentes por amostra, medindo o que torna uma resposta de IA útil, coerente e correta.

Safety: Nemotron-Safety-Guard-Dataset-v3 (514.617 linhas, 12 idiomas, CC BY 4.0) e Nemotron-Content-Safety-Reasoning-Dataset (CC BY 4.0) classificam conteúdo em categorias de risco. O Nemotron-3.5-Content-Safety-Dataset e o Nemotron-AIQ-Agentic-Safety-Dataset-1.0 completam a família, o segundo sob licença proprietária de avaliação, não aberta.

O que a DNACX já usa, e por quê

Este site usa o Nemotron-Personas-Brazil em duas superfícies: as páginas municipais de /geo-cx-municipal (distribuição de escolaridade e ocupação por cidade) e o gerador de hipótese de reação de cliente em /persona-cx, sempre rotulado como dado sintético, nunca como medição real. É o único dataset da família com schema confirmado campo a campo nesta análise, e a única aplicação já em produção.

Para quem quer usar um Nemotron além do Brasil

A regra prática: se o dataset está sob CC BY 4.0, dá para citar estatística e publicar análise, com atribuição. Se está sob a licença de acesso a dados da NVIDIA, ele serve só para treinar modelo, nunca para republicar. Confirmar a licença específica de cada dataset antes de usar continua sendo necessário: mesmo dentro de famílias majoritariamente CC BY 4.0 existem exceções internas, subconjunto por subconjunto.

Quero aplicar isso na minha operação

Esse artigo faz parte do hub CX para SaaS.

FAQ

Perguntas frequentes

Todos os datasets Nemotron são da mesma família?

Não. O nome Nemotron cobre pelo menos seis famílias diferentes (Personas, CC, Pretraining, Post-Training, Reward/HelpSteer e Safety), cada uma com finalidade e licença próprias. Tratar todos como equivalentes é o erro mais comum ao citar essas bases.

Posso usar qualquer dataset Nemotron para escrever um artigo ou publicar uma estatística?

Só os que estão sob licença CC BY 4.0, como toda a família Personas, HelpSteer e as bases de segurança de conteúdo. Os datasets de pré-treino web (Nemotron-CC, Nemotron-Pretraining) estão sob uma licença que proíbe redistribuir ou publicar o dado, mesmo em forma de estatística extraída.