Como medir o efeito de algo que já aconteceu, quando não dá mais para sortear quem recebe.
Uma empresa gastou milhões desenvolvendo centenas de agentes de IA e contratou uma consultoria conhecida para medir o impacto. O relatório dizia que os gerentes que participaram venderam 30 por cento a mais e que as áreas ganharam 20 por cento de eficiência. O CEO bateu palmas e pagou a fatura. Só que os gerentes que participaram foram convidados justamente por já performarem melhor, de modo que o número entregue mede viés de seleção e não efeito. A consultoria não quebrou contrato nem cometeu erro de conta. O contrato é que não dizia como o grupo de comparação deveria ser construído.
O padrão se repete em escalas diferentes. Uma rede de varejo pediu no Termo de Referência que se comparasse quem instalou o aplicativo de fidelidade com um grupo controle que não instalou, e recebeu de volta a conclusão de que quem tem o aplicativo gasta 50 vezes mais, porque quem baixa é o cliente frequente que já gastava muito. Na segunda rodada a consultoria usou pareamento, cumpriu a exigência e entregou um aumento de dez centavos por cliente apurado sobre doze pessoas com par perfeito, cobrando R$ 1 milhão num projeto de R$ 2 milhões. Um diretor de vendas lançou um aplicativo de descontos em outubro, viu as vendas subirem 30 por cento em novembro e levou o resultado ao conselho sem notar que novembro é Black Friday. Um diretor de RH trocou a escala 6x1 pela 5x2 e creditou à mudança os 10 por cento de ganho de produtividade do semestre em que a economia melhorou, entraram ferramentas de IA e um software novo foi instalado. Um CEO investiu R$ 15 milhões numa única loja conceito em Curitiba, viu o faturamento subir 20 por cento em doze meses e agora precisa decidir sobre 500 lojas.
Quem já sabe analisar dados reconhece o problema nesses casos e mesmo assim trava, porque o que falta não é diagnóstico, é método. Saber que correlação não é causa não produz um contrafactual. Saber que um grupo controle é necessário não ajuda quando a política já foi lançada, o produto já foi vendido, a lei já mudou e ninguém pode sortear quem recebe o benefício. O Nível 1 forma o arquiteto, que desenha a prova na prancheta antes da obra e pode recusar o projeto. Este nível trata da obra já em andamento, em que o desenho não está mais disponível e o profissional é convocado a construir a evidência com o que existe.
Antes disso, há uma camada que costuma passar despercebida por quem opera bem a ferramenta. Uma célula vazia raramente é esquecimento. Num programa de reforço escolar com um quarto das crianças sem nota final, deletar as linhas vazias faz a média subir e o programa vira sucesso, quando a criança ausente é a que ficou sem internet ou precisou trabalhar. Uma faixa de renda larga demais faz noventa por cento dos respondentes marcarem a mesma opção e transforma a variável em massa sem poder de discriminação. Um questionário que esquece de perguntar se a pessoa participou do programa impede qualquer atribuição causal, por mais sofisticado que seja o modelo aplicado depois. Nenhuma dessas falhas se conserta com código.
O curso trata identificação causal como decisão de engenharia, e não como escolha de biblioteca. São doze vídeos e 4h38, começando pela camada anterior ao método, a governança do significado do dado, a engenharia de proxies e a auditoria do campo vazio, passando pela validação de construto com análise de componentes principais e análise fatorial exploratória, e percorrendo depois o arsenal quase-experimental na ordem em que a estrutura do problema costuma aparecer: regra rígida com ponto de corte pede regressão descontínua, livre escolha pede pareamento, choque numa data pede diferenças em diferenças com auditoria por gráfico de evento, uma única unidade tratada pede controle sintético e uma base quase vazia pede completude de matrizes. O fecho é o Termo de Referência, que transforma tudo o que veio antes em cláusula contratual. Dois vídeos são test-drives, versões condensadas de cerca de vinte minutos que cobrem PCA e regressão descontínua num deles e diferenças em diferenças e pareamento no outro.
De cada método o curso pede quatro coisas: quando ele se aplica, qual premissa ele exige, como se lê a saída e como ele falha. Nenhuma aula pede cálculo ou derivação. Não há Python, R, SQL, Excel avançado nem Power BI, e o aluno não roda nenhum estimador. Ficam de fora, como no Nível 1, a construção de modelos preditivos, a colocação em produção e a gestão do ciclo de vida de modelos.
O vocabulário do Nível 1 é pressuposto: causalidade, grupo controle, aleatorização, teste A/B, viés de seleção, viés de variável omitida, variável de tratamento, fator Z, tamanho de efeito, poder estatístico e valor-p aparecem sem ser redefinidos do zero. As aulas de PCA e análise fatorial e a de completude de matrizes são as menos dependentes desse vocabulário e podem ser assistidas isoladamente. As demais partem de onde o Nível 1 parou.
Não é para: Não é para quem procura treinamento em ferramenta ou em código, porque não há Python, R, SQL nem Power BI em nenhuma aula. Também não é para quem precisa da derivação matemática dos estimadores, nem para quem vai construir modelos preditivos e colocá-los em produção, porque essas etapas ficam fora dos dois níveis.
O peso não é opinião. Ele vem da proporção de famílias de itens que o banco dedica a cada domínio, e a prova é montada por ele.
Separa dono do cano de dono da água. A área técnica responde pela segurança, pela integridade e pela velocidade do fluxo, e a área de negócio ou de política pública responde pelo significado da variável e pela sua fonte. A governança semântica é obrigação intransferível de quem é dono do conceito, e a regra do domínio é que o código não conserta o que a governança não definiu.
Ataca: Tratar coleta de dados como assunto técnico, delegar a definição do construto ao fornecedor ou ao time de dados, automatizar o cálculo de um indicador cuja definição nunca foi acordada e ler como falha de sistema aquilo que é divergência de significado entre duas áreas.
Trata o desenho do instrumento de coleta quando a variável ideal não existe no sistema. A proxy é um substituto investigativo que mede o rastro deixado pelo conceito e precisa ser observável, independente da memória do respondente e ligada ao problema real. Cobre a proxy de hábito no lugar da pergunta de valor agregado, piso e teto de resposta, fadiga de pesquisa e o fechamento do cerco causal, que é medir a variável de tratamento e os confundidores.
Ataca: A variável de vaidade da autoavaliação, a viagem de memória, a faixa de resposta que satura a escala antes da intervenção e o questionário que deixa de fora justamente a pergunta sobre participação no programa.
Trata a célula vazia como informação e não como erro de preenchimento. Separa ausência aleatória de ausência sistemática, exige perguntar por que esta linha, por que esta coluna e quem é a pessoa que não preencheu, e mostra como apagar o vazio produz viés de sobrevivência, deixando na base apenas quem já ia dar certo. Inclui registrar o motivo da ausência como variável em vez de apenas preencher o campo.
Ataca: Deletar a linha ou imputar a média antes de descobrir qual processo produz o vazio, fabricando um dado que confirma justamente a hipótese que interessava confirmar.
Separa dois objetivos que costumam ser confundidos. O PCA comprime redundância e se lê pela variância explicada. A análise fatorial exploratória procura o fator latente que faz várias variáveis andarem juntas e se lê pelas cargas fatoriais. A direção da seta é oposta nos dois, porque no PCA as variáveis constroem o componente e no EFA o fator causa as variáveis. Nomear o fator é leitura das cargas feita por quem conhece o negócio, e não saída do algoritmo.
Ataca: O fio da marionete, quando variáveis correlacionadas são puxadas por um fator indesejado como orçamento ou porte e o índice de inovação acaba medindo tamanho de caixa. Também manter a pergunta com carga baixa em todos os fatores, ler peso vindo da variância como se fosse prioridade de política e tomar uma proxy isolada pelo construto inteiro.
Reúne a regressão descontínua e a regra de escolher o método pela estrutura de atribuição do tratamento. Toda regra rígida com ponto de corte cria um sorteio acidental, e o efeito é o salto na descontinuidade, não a diferença entre as médias dos dois lados inteiros. Cobre o princípio da aleatoriedade local, a escolha da janela e o trade-off entre viés e variância, Sharp contra Fuzzy, e as variantes em que a variável de corrida é uma data ou uma fronteira geográfica.
Ataca: Manipulação da variável de corrida por quem conhece a fronteira, janela escolhida pelo volume de dados, resultado apresentado com uma janela só, covariáveis tratadas como correção de viés e escolha do método pelo hábito ou pela sofisticação em vez da estrutura do problema.
Constrói o gêmeo estatístico de cada unidade tratada quando a entrada no programa foi por livre escolha e não por regra. Cobre correspondência exata, escore de propensão e pareamento exato engrossado, o critério para escolher entre eles, quais variáveis entram no pareamento conforme o mecanismo de seleção, o descarte de quem não tem par e o efeito disso sobre a população a que a conclusão se aplica. A auditoria se faz pelo balanço de covariáveis antes de olhar o resultado.
Ataca: A premissa de seleção em observáveis levada longe demais, porque se a variável que governa a adesão não é observável o pareamento não resolve o viés de seleção. Também parear por variável medida depois do início do tratamento e generalizar para toda a população tratada uma conclusão obtida apenas entre os pareados.
Subtrai a variação do comparador da variação da unidade tratada e trata a tendência paralela como critério inegociável do comparador, em que comportamento no passado importa e nível de partida não importa. Cobre DiD escalonado por coortes quando as unidades entram em datas diferentes, projeções locais quando o efeito muda ao longo do horizonte, e o gráfico de evento como auditoria visual, com leitura dos coeficientes anteriores ao zero, pré-tendência, efeito de antecipação e intervalo que cruza o zero.
Ataca: O erro do antes contra depois, que omite o cenário macroeconômico. A comparação proibida, que usa como controle quem já foi tratado em data anterior. E a média que esconde a dinâmica, transformando um pico seguido de queda no mesmo número que um efeito estável.
Fabrica o comparador quando existe uma única unidade tratada e nenhum espelho natural. Cobre o conjunto de doadores e o critério de inclusão, as duas travas de ponderação, sem peso negativo e soma igual a cem por cento, a janela histórica compatível com a frequência de medição das variáveis, a exigência de a unidade tratada estar dentro da faixa das doadoras e a inferência por placebo no espaço e no tempo, que substitui o valor-p quando há uma só unidade tratada.
Ataca: Overfitting no período anterior à intervenção, em que o ajuste quase perfeito indica que o algoritmo imitou ruído. Doador contaminado por transbordamento, que infla o contrafactual e faz o método subestimar o efeito. E o ruído personalizado de um doador de peso alto que sofreu choque próprio depois da intervenção.
Recupera informação de uma matriz quase vazia pela estrutura de baixo posto, porque a matriz é gigante e a complexidade por trás dela é pequena, com poucos padrões recorrentes, as tribos, explicando muitas linhas. O fator latente conecta itens e unidades sem que o algoritmo leia o conteúdo. Cobre o limite do método no arranque frio e as duas saídas para ele, a fricção intencional na entrada e os dados auxiliares de contexto.
Ataca: Tratar noventa e nove por cento de vazio como base inutilizável, explicar a recuperação pelo tamanho da base ou pela média da coluna em vez do baixo posto, e estender ao caso sem nenhum histórico um método que só recupera o que está ancorado em algum registro da própria unidade.
Transfere o método para dentro do contrato. O Termo de Referência tem três pilares, a dor, o construto e a trava. Pede-se resposta para uma decisão e não um estudo, define-se como o resultado será medido em vez de deixar o fornecedor inventar, e escreve-se o método obrigatório, o tamanho mínimo de amostra e o efeito mínimo aceitável. Abaixo do limiar contratado o resultado é classificado como impacto nulo. Antes de publicar, o termo passa por red teaming contra a leitura mais preguiçosa possível.
Ataca: Escrever grupo controle no contrato sem dizer como esse grupo deve ser construído, assinar contrato cuja amostra só enxerga efeitos muito maiores que o mínimo exigido, e tratar como sucesso um resultado positivo que não paga o projeto.
Todas as aulas são gratuitas e abertas no YouTube. A carga horária declarada soma o tempo de vídeo mais o tempo de prática e leitura sugerido por aula.
| Nível | O que a pessoa faz | Cargo típico |
|---|---|---|
| Governança do dado na origem | Define o significado das variáveis antes da coleta, desenha proxies defensáveis, audita o campo vazio como rastro de processo e recusa que o construto seja herdado do sistema. | Analista de BI, People Analytics, ESG, analista de políticas públicas, dono de produto de dados |
| Validação de construto | Lê variância explicada e cargas fatoriais, separa compressão de descoberta de fator, corta a pergunta que não mede nada e identifica o fator indesejado que move um índice. | People Analytics, pesquisa, marketing analytics, psicometria aplicada, rating e crédito |
| Seleção de método de identificação | Escolhe entre regressão descontínua, pareamento, diferenças em diferenças, controle sintético e completude de matrizes pela estrutura de como o tratamento foi atribuído, e reconhece quando nenhum deles se sustenta. | Data scientist causal, economista, avaliação de impacto, monitoramento e avaliação, pricing |
| Auditoria de entrega de terceiro | Exige a prova antes de aceitar o resultado, gráfico de evento para a pré-tendência, balanço de covariáveis para o pareamento e distribuição de placebos para a significância. | Auditoria interna, model risk, controladoria, PMO, conselho e comitês |
| Contratação de evidência | Redige Termo de Referência com construto, método obrigatório, threshold e trava de amostra, e recusa o contrato cuja amostra não sustenta o efeito mínimo exigido. | Compras técnicas, jurídico contratual, diretoria de estratégia, setor público |
A correspondência com cargos é descritiva. Ela ajuda a situar o escopo e não é promessa de emprego nem de promoção.
Este é um curso livre. Não é pós-graduação, não é extensão universitária regulada, não confere título acadêmico nem registro profissional e não substitui formação regulada de nenhum tipo. A carga declarada é de sete horas, somando 4h38 de vídeo em doze aulas mais prática e leitura. Para dar ordem de grandeza, o mínimo regulatório de uma especialização lato sensu no Brasil é de 360 horas, e um MBA executivo costuma passar disso. Em tempo, portanto, o que está aqui equivale a um módulo curto dentro de uma formação longa, e não a uma formação.
Em escopo, o mapa mais próximo é o corpo de conhecimento em sete domínios usado pelo exame Certified Analytics Professional, do INFORMS. O Nível 2 cobre integralmente o domínio de seleção de metodologia e toca parcialmente o domínio de dados, com governança semântica, engenharia de proxies e tratamento do dado faltante. Os dois primeiros domínios, enquadramento do problema de negócio e enquadramento do problema analítico, são cobertos no Nível 1. Ficam inteiramente de fora construção de modelo, colocação em produção e gestão do ciclo de vida de modelos. Isso é um mapeamento descritivo de conteúdo, feito por nós, e não afirma vínculo, endosso, equivalência nem preparação formal para aquele exame. O mapeamento é publicado justamente para que a lacuna fique visível. Do mesmo modo, a matriz de capacidade acima descreve competências exigidas nas funções citadas e não promete colocação nem progressão.
O desenho vem da tradição de avaliação de impacto e da econometria aplicada, e não da estatística computacional. A espinha é a ideia de identificação: antes de qualquer estimativa existe a pergunta de o que, na maneira como o tratamento foi atribuído, permite separar efeito de seleção. A regressão descontínua explora a regra rígida que produz aleatoriedade local na fronteira. O pareamento constrói o gêmeo estatístico sob a premissa de seleção em observáveis, com correspondência exata, escore de propensão e pareamento exato engrossado. As diferenças em diferenças usam a trajetória paralela do comparador como contrafactual, com as correções que a literatura recente introduziu para tratamento escalonado e com projeções locais quando o efeito muda ao longo do horizonte. O controle sintético fabrica o comparador por combinação ponderada de doadores quando existe uma única unidade tratada, e troca o valor-p por inferência de placebo. A completude de matrizes recupera informação por estrutura de baixo posto. A validação de construto entra por análise de componentes principais e análise fatorial exploratória, que respondem a perguntas opostas e não são intercambiáveis.
Nenhuma aula pede derivação nem cálculo. De cada método o curso cobra quatro coisas: quando ele se aplica, qual premissa ele exige, como se lê a saída e como ele falha. Por isso as premissas aparecem sempre como objeto de auditoria verificável, gráfico de evento para a pré-tendência, balanço de covariáveis para o pareamento, ajuste do período anterior para o controle sintético e distribuição de placebos para a significância. O fecho é contratual, porque os mesmos critérios que servem para auditar viram cláusula de Termo de Referência, e a diferença entre métrica de vaidade e evidência está na precisão com que a regra do jogo foi redigida, não na ferramenta que o fornecedor usa no computador.
20 questões · 75 minutos · proficiência a partir de 0,60, excelência a partir de 0,80
A prova tem 20 itens de múltipla escolha e 60 minutos, sorteados de um banco com 60 famílias de itens e 180 variantes. Cada família tem três variantes isomórficas ambientadas em setores diferentes, de modo que duas pessoas recebem a mesma exigência cognitiva em contextos distintos. Seis famílias funcionam como âncoras e se repetem entre as formas para permitir comparação psicométrica, e são justamente os princípios que recorrem em mais de uma aula: tendências paralelas como critério do comparador, escolha do método pela estrutura do problema, exigência da prova antes do resultado, o gêmeo estatístico como critério, o viés de seleção que sobrevive a método sofisticado e o vazio como informação. As demais 54 famílias rotacionam. Nenhum item exige cálculo, porque o curso não usa fórmula, e os itens de nível avaliar vêm com um quadro de apoio. Toda alternativa errada carrega um equívoco nomeado, o mesmo que aparece na coluna de equívocos de cada domínio, e o peso de cada domínio na prova segue a proporção de famílias rotativas do banco, que vai de 3,7 por cento em Governança contratual a 16,7 por cento em PCA e EFA.
O certificado é gratuito, registra a carga horária de sete horas e a banda alcançada, e traz código de validação verificável.
As notas de corte estão padronizadas em 0,60 para proficiência e 0,80 para excelência, iguais nos três exames. Elas são provisórias, e a página de validação sempre diz qual método produziu o número em vigor.
As condições de leitura são escolha do candidato e não pedem justificativa. Qualquer pessoa pode fazer a prova com 60, 75, 90 ou 120 minutos, aumentar a letra, abrir o espaço entre linhas, esconder o relógio, ler qualquer artefato como texto em vez de imagem, e pausar por até sete minutos com o relógio parado. Não perguntamos o motivo e não registramos nenhum.
Metodologia completa, notas de corte e desempenho de modelos de linguagem
| Se você é | Ordem | Por quê |
|---|---|---|
| Quem precisa auditar uma entrega de consultoria ou de fornecedor | Vídeos 1 e 2, depois 8 e 9, depois 12 | Junta a propriedade do significado do dado com o critério de tendências paralelas e a prova visual, e termina no termo que amarra o fornecedor antes de ele abrir o computador. |
| Quem vai avaliar um piloto ou uma política já lançada | Vídeos 1 e 6, depois 7, depois 5, depois 8, 9 e 10 | Percorre os métodos de identificação na ordem em que a estrutura do problema costuma aparecer, da livre escolha à regra rígida, ao choque numa data e ao caso de uma unidade só. |
| Quem constrói índice, pesquisa ou instrumento de coleta | Vídeos 2, 3 e 4, depois 11 | Concentra governança semântica, proxies, dado faltante e validação de construto, e fecha na recuperação de informação a partir de uma base quase vazia. |
| Quem tem quinze minutos e quer decidir se o curso serve | Vídeos 1, 3 e 6 | A introdução mais os dois test-drives dão a versão condensada de quatro dos cinco métodos, sem exigir a sequência inteira. |
| Quem quer a formação completa | Vídeos 1 a 12, na ordem | As aulas são cumulativas e o vocabulário de uma reaparece na seguinte. Os vídeos 3 e 6 são test-drives das aulas que vêm depois e funcionam como leitura prévia ou revisão. |
Não há Nível 3 de análise de dados. Depois deste ponto a trilha se abre em três frentes, e a escolha depende do que vem a seguir no trabalho de cada um. Machine Learning para Gestores continua exatamente onde os dois níveis param de propósito, na construção de modelos e no que acontece com eles depois do piloto, com aulas sobre o algoritmo que aprende o viés e sobre por que projetos que funcionam no piloto morrem na escala. Agentic AI Governance é a formação executiva sobre inteligência artificial, em inglês, em dez masterclasses que vão do vocabulário que executivos usam errado até governança, arquitetura e o deslocamento macroeconômico. Análises IA para Executivos reúne análises avulsas sobre risco, segurança e arquitetura de sistemas de IA, para quem precisa acompanhar o assunto sem seguir uma sequência de curso.
Para quem chegou aqui pelo certificado de alguém e quer o começo da trilha, o Nível 1, Análise de Dados do Zero, é o pré-requisito conceitual deste curso: é lá que estão problema investigável, conceito e indicador, contrafactual, mecanismo, as três validades, o conjunto de vieses e a leitura de p-valor, tamanho de efeito e intervalo de confiança.
O Estúdio 68 tem duas frentes. Esta página é do programa gravado, assíncrono, de acesso aberto e gratuito, que você faz no seu ritmo e cuja avaliação é online.
O programa ao vivo é síncrono, em turmas, e cobre o mesmo terreno com mais tempo e mais profundidade: discussão de caso com a turma, revisão do trabalho de cada participante e adaptação ao contexto de quem está na sala, coisas que a gravação não faz. Ele tem vagas reservadas a grupos minorizados. O certificado das duas frentes é distinto, e cada um diz o que foi feito.
A Micah 6 AI é a consultoria que mantém o Estúdio 68. Ela atende empresas em projetos de evidência e de IA, e não participa da avaliação nem da emissão de certificado. micah6ai.com