O que o podcast do NotebookLM entrega de verdade, agora com o nome Gemini Notebook
Em 16 de julho de 2026 o Google renomeou o NotebookLM para Gemini Notebook. É o mesmo produto: os notebooks antigos continuam lá, o botão do Audio Overview funciona do mesmo jeito, e a maioria das pessoas ainda busca por NotebookLM, por isso os dois nomes aparecem neste guia. Você sobe fontes, um PDF, uma lista de links, suas anotações, e a ferramenta transforma tudo numa conversa entre apresentadores de IA que você pode baixar como arquivo de áudio.
O Audio Overview tem quatro formatos. Deep Dive, o padrão, são dois apresentadores conversando sobre o material. Brief é um apresentador em menos de 2 minutos. Critique são dois apresentadores fazendo uma avaliação crítica das fontes. Debate são dois apresentadores num debate formal. A divisão de uso relatada pela conta oficial é Deep Dive 45,1%, Debate 26,7%, Critique 16,2% e Brief 12%. Ou seja, quase metade de tudo o que sai da ferramenta é a mesma conversa de dois apresentadores, e 88% usa duas vozes.
Os controles são mais finos do que parecem. Mais curto, Padrão e Mais longo existem só em inglês, então nos mais de 80 outros idiomas vale a duração padrão. Dá para escrever um prompt de foco com o tema e o nível de especialidade, mas não existe seleção de voz documentada, então todo usuário recebe os mesmos apresentadores. O modo interativo é só em inglês. O próprio aviso do Google diz que os overviews, vozes incluídas, podem conter imprecisões ou falhas de áudio. Existe ainda o Video Overview, que transforma as fontes em slides narrados.
É muito valor para quem está aprendendo um assunto. Não é a mesma coisa que um canal de vídeo com IA no automático, e a distância entre um resumo em áudio e um vídeo que um canal publica toda semana é exatamente onde a monetização é decidida.
- Deep Dive: dois apresentadores, o padrão, 45,1% do uso.
- Debate: dois apresentadores, debate formal, 26,7%.
- Critique: dois apresentadores, avaliação crítica, 16,2%.
- Brief: um apresentador, menos de 2 minutos, 12%.
- Controle de duração e modo interativo: só em inglês. Seleção de voz: nenhuma documentada.
Problema um: as mesmas duas vozes de milhões de outros uploads
A qualidade da voz não é o problema. Os apresentadores soam naturais, riem, interrompem um ao outro, respiram. O problema é que são os mesmos dois apresentadores, com os mesmos tiques, o "wow", o "exactly", o "so basically", num número enorme de uploads. Quem já ouviu um podcast do NotebookLM reconhece o próximo em cinco segundos, e o revisor do Programa de Parcerias também.
A política de monetização do YouTube (central de ajuda, resposta 1311392) chama isso de conteúdo inautêntico, o nome dado em 15 de julho de 2025 ao que antes era conteúdo repetitivo. Ela exclui conteúdo repetitivo ou produzido em massa, e entre os exemplos cita conteúdo gerado por IA feito com modelos genéricos ou pouco originais. Um canal em que todo episódio são os mesmos dois apresentadores padrão reagindo a um PDF diferente é esse modelo na forma mais pura: só o arquivo de entrada muda. O que a política permite é série com episódios distintos, com comentário e narrativa próprios.
É também por isso que uma voz mais bonita não resolve. O guia sobre por que a narração de IA soa robótica trata dos problemas de ritmo que fazem uma voz soar falsa. Aqui o problema é o contrário: a voz convence, mas é de todo mundo. O que protege um canal é uma voz que é só sua.
No FalconVid essa voz é a sua voz clonada ou uma voz premium ultra realista escolhida para o canal, e o DNA de canal mantém as mesmas vozes, o mesmo estilo e a mesma legenda do episódio 1 ao episódio 300.

Problema dois: 12 minutos de áudio em cima de uma imagem parada
O Audio Overview é áudio. Para subir no YouTube, a maioria coloca uma capa fixa, talvez uma onda sonora mexendo, e publica. Por 12 minutos a tela quase não muda. A política de monetização cita slideshow com pouca ou nenhuma narrativa entre os formatos que não se qualificam, e uma imagem parada com uma onda sonora por cima é esse slideshow com um slide só.
No YouTube as pessoas assistem, não só escutam. Uma conversa de 12 minutos no ritmo de podcast tem mais ou menos 1.700 a 1.900 palavras. Um vídeo de 12 minutos que segura atenção precisa de uma imagem nova a cada 4 a 6 segundos, ou seja, 120 a 180 cenas. O áudio é talvez um terço do trabalho.
A retenção é o que transforma isso em dinheiro. A regra nova do Programa de Parcerias pede 8.000 horas públicas de exibição em 365 dias para quem entrar a partir de 1º de fevereiro de 2027, e hoje ainda são 4.000. Um vídeo de 12 minutos assistido até 40% entrega 4,8 minutos por view, então 8.000 horas pedem 100.000 views. O mesmo vídeo assistido até 20% entrega 2,4 minutos e precisa de 200.000 views para as mesmas horas. O guia sobre como a retenção compra horas de exibição mostra por que cada ponto de duração média é um desconto nas views que você precisa.
No FalconVid as cenas são geradas para o roteiro, mudando a cada poucos segundos, com legenda karaokê em mais de 15 estilos por cima, então a conversa ganha uma imagem que anda junto com ela, em vez de uma capa congelada.
Problemas três e quatro: nenhum controle sobre o arquivo, e fontes que não são suas
Primeiro o controle. Fora do inglês a duração é travada. Você não escolhe as vozes. Você não edita o roteiro linha a linha: para mudar uma frase, regenera o overview inteiro e recebe outra conversa. E quando o aviso sobre imprecisões se confirma, não existe conserto pontual: uma data errada no minuto 7 significa conviver com ela ou regenerar e conferir 12 minutos de novo.
Depois a fonte. Um Audio Overview resume o que você subiu. Se as fontes são o artigo, o livro ou o relatório de outra pessoa, o episódio é a leitura de material que você não criou, e a política de conteúdo reutilizado exclui isso. O Google não reivindica o conteúdo gerado, mas os termos avisam que ele pode gerar conteúdo igual ou parecido para outras pessoas, e nos Estados Unidos conteúdo puramente gerado por IA, sem autoria humana suficiente, em geral não tem proteção de direito autoral.
O quadro muda quando a fonte é sua. Se você já grava o seu próprio programa, as palavras eram suas desde o começo, e o guia sobre transformar episódio de podcast em vídeo cobre esse caminho, que não tem nenhum desses problemas.
No FalconVid a duração é uma configuração em qualquer um dos 63 idiomas, não só em inglês. O Studio deixa você assistir à versão 1 e consertar um trecho, encurtar a introdução, trocar uma cena, mudar a música ou abrir a timeline, sem regenerar o vídeo inteiro. E um projeto pronto pode ser duplicado para outro idioma pagando só a diferença, o oposto de uma duração padrão travada fora do inglês.
O que o FalconVid faz: o podcast em vídeo que o arquivo do NotebookLM não consegue ser
O FalconVid foi feito para a parte em que o NotebookLM para. Você aprova o calendário uma vez, e especialistas de IA trabalham em paralelo: o pesquisador lê várias fontes, o roteirista monta um roteiro original com o seu ângulo, e o narrador, o editor e o sound design trabalham ao mesmo tempo, com o vídeo pronto em até 30 minutos. Colar o seu próprio roteiro é opcional.
O formato de conversa é nativo. Multi-personagem com vozes distintas está em todos os planos, e na narração com IA você escolhe vozes premium ultra realistas ou a sua própria voz clonada. A narração é cobrada por minuto de vídeo, não por voz: 24 créditos por minuto no premium, 288 em 12 minutos, e 3 créditos por minuto no econômico, 36 em 12 minutos. A segunda voz não custa nada a mais, e já está dentro do custo do vídeo.
Em volta das vozes vem tudo o que falta no arquivo de áudio: cenas geradas para o roteiro, legenda karaokê, a capa, o SEO do vídeo, um Short 9:16 de até 60 segundos, e a publicação no YouTube, Instagram, TikTok, Rumble e Facebook no horário agendado.
Onde o NotebookLM é excelente, e o formato que paga
Nada disso faz da ferramenta uma ferramenta ruim. Como ferramenta de estudo e pesquisa ela é excelente: lê 20 fontes mais rápido que você, deixa você ouvir um assunto antes de escrever sobre ele, e mostra em 10 minutos se um tema tem material para um episódio de 12 minutos. Para um canal, isso é o rascunho ideal da pauta, não o episódio.
O formato que monetiza mantém o que as pessoas gostam no podcast de IA, duas vozes conversando, e muda tudo o que o deixa genérico. O roteiro é seu, montado a partir de várias fontes e com um ângulo. As duas vozes têm função: um narrador que carrega a história e um especialista ou contraditor que entra 4 a 6 vezes com o número, a ressalva ou a objeção que o espectador está pensando. O guia sobre narração com duas vozes no YouTube mostra por que é essa função que segura atenção.
A conta de um episódio: na mão em cima do áudio do NotebookLM contra o automatizado
Na mão, o áudio é a parte rápida. Gerar leva minutos, mas depois você ouve os 12 minutos inteiros para conferir os fatos, muitas vezes duas vezes, porque um erro significa uma nova geração. A imagem é a parte pesada: 120 a 180 cenas, de 3 a 5 horas. Sincronizar, legendar, capa, SEO e upload somam mais 2 a 3 horas. São de 6 a 9 horas por episódio, ainda com os mesmos dois apresentadores de todo mundo, e um episódio por semana é o teto para quem tem emprego fixo.
No FalconVid, na régua de hoje, um vídeo de 12 minutos custa 1.731 créditos no econômico, 4.597 no balanceado e 16.131 no premium, e o vídeo chega com cenas, legenda, capa, SEO e o seu Short. O Starter, com 15.000 créditos, cobre 8 vídeos no econômico ou 3 no balanceado por mês, ou uma mescla de 2 balanceados e 3 econômicos que usa 14.387 créditos. O Pro cobre 17 no econômico, 6 no balanceado ou 1 no premium, em 5 canais. O Business cobre 54 no econômico, quase dois por dia, em 10 canais.
O canal manual em cima do áudio do NotebookLM publica um episódio genérico por semana. O automatizado publica dois ou mais por semana já no Starter, com vozes próprias, e escala para 109 vídeos no econômico em 25 canais no Agency ou 184 em 50 canais no Scale.

