Dos reglas de cobro, y apuntan hacia lados opuestos
Todo el mundo llega a esta pregunta con el mismo instinto: un elenco debe ser caro, porque más personajes significan más trabajo y más cuenta. Dentro del motor pasa lo contrario, por una razón muy concreta. La narración se cobra por minuto de video terminado. El lip sync se cobra por segundo de rostro en pantalla. Esas dos unidades deciden el formato antes de cualquier discusión de gusto.
Empieza por la narración. En un video de 12 minutos, la voz premium cuesta 24 créditos por minuto, lo que da 288 créditos en el video entero, unos $0,90 con el crédito valiendo $0,003133. La voz económica cuesta 3 créditos por minuto, o sea 36 créditos en esos mismos 12 minutos, unos $0,11. Ahora fíjate en lo que falta en esa fórmula: la cantidad de voces. Un narrador solo o seis personajes intercambiando frases, siguen siendo 12 minutos de video y siguen siendo 288 créditos en voz premium.
Ahora el lip sync, que es lo que un avatar de IA es en realidad. Se cobra por segundo de rostro en pantalla, porque cada uno de esos segundos es una generación. Kling Avatar Standard cuesta 32 créditos por segundo, unos $6,02 por minuto de rostro. Kling Avatar Pro cuesta 64 por segundo, unos $12,03 por minuto. HeyGen cuesta 80 por segundo, unos $15,04 por minuto. OmniHuman 1.5 cuesta 112 por segundo, unos $21,05 por minuto. No hay licencia por personaje ni mensualidad por avatar. Lo que compras es tiempo de pantalla.
Aquí está la equivalencia que vuelve concreta la asimetría. Nueve segundos de un segundo rostro en pantalla con Kling Avatar Standard cuestan 288 créditos. Es exactamente lo que cuesta narrar los 12 minutos completos en voz premium, para todos los personajes del guion, sean los que sean. Nueve segundos de un rostro visible de más equivalen a doce minutos de todas las voces que quieras. Al revés: poco más de un segundo de ese mismo rostro cuesta 36 créditos, el precio de narrar el video entero con la voz económica.
Así que la frase honesta, la que debería guiar la decisión de formato, es esta. El diálogo es casi gratis y el elenco visible no lo es. Escribir cuatro personajes en un guion suma cero créditos a la línea de narración. Mostrar cuatro rostros suma 32 créditos por segundo, por rostro, mientras sigan en el cuadro. Todo lo demás en este artículo es consecuencia de esa única asimetría.
La aritmética del elenco: no son los personajes, son los rostros simultáneos
Empieza por la base. Un video de 12 minutos en modo económico cuesta 1.008 créditos, unos $3,16. Suma 90 segundos de rostro con Kling Avatar Standard y sumas 90 por 32, que dan 2.880 créditos, unos $9,02. El video cierra en 3.888 créditos, unos $12,18. Ese es el número de referencia del formato con presentador único, y toda comparación de abajo se mide contra él.
Ahora pon dos avatares en el mismo video, alternando, nunca juntos en el cuadro. Un presentador toma 45 segundos y un reportero toma 45 segundos. Cuenta los segundos de rostro que de verdad aparecen en pantalla: siguen siendo 90, porque solo hay un rostro a la vez. La línea de lip sync sigue en 2.880 créditos y el video sigue cerrando en 3.888. El segundo personaje, con nombre propio, voz propia e identidad visual propia, sumó exactamente cero créditos a la cuenta.
Ahora pon esos mismos dos avatares en el mismo cuadro durante esos mismos 90 segundos, en pantalla dividida o en un plano de dos. Dos relojes corren a la vez. El motor genera 180 segundos de rostro, así que la línea de lip sync se vuelve 5.760 créditos y el video cierra en 6.768, unos $21,20. Mismo guion, mismos dos personajes, los mismos 90 segundos de pantalla, y la cuenta subió 74 por ciento.
Para el extremo del rango, toma la cabeza parlante entera: 12 minutos de rostro, que son 720 segundos. Con Kling Avatar Standard eso da 23.040 créditos, así que el video cierra en 24.048, unos $75,34. Es 6,2 veces la versión con elenco alternado del mismo contenido exacto, y por eso la decisión de formato vale más que cualquier ajuste que hagas al guion.
La regla que sale de ahí es corta y es el artículo entero. Un elenco no se encarece por tener más personajes. Se encarece por tener más rostro en pantalla al mismo tiempo. El corte de reacción y el plano alternado son el formato barato. La pantalla dividida es el caro. Y resulta ser la misma gramática de edición que todo programa de entrevistas bien hecho usa desde hace décadas, así que la opción barata también es la que parece más profesional.
- Video de 12 minutos en modo económico: 1.008 créditos, unos $3,16.
- Un presentador, 90 segundos de rostro con Kling Avatar Standard: 2.880 créditos, total de 3.888.
- Dos presentadores alternando, los mismos 90 segundos en pantalla: los mismos 3.888 créditos.
- Dos presentadores compartiendo el cuadro, 90 segundos: 180 segundos de rostro, 5.760 créditos, total de 6.768.
- Cabeza parlante entera de 12 minutos: 720 segundos de rostro, 24.048 créditos, unos $75,34.
Cuándo gana el presentador único: el reconocimiento se construye repitiendo
El argumento más fuerte a favor de un solo presentador no tiene nada que ver con créditos. Es el reconocimiento. Quien está bajando por el feed decide el clic en bastante menos de un segundo, y dentro de esa ventana un rostro familiar es una señal más fuerte que cualquier titular. Después de 30 o 40 videos con el mismo presentador, ese rostro deja de ser una elección de diseño y se vuelve el logo del canal. La gente lo reconoce en la miniatura antes de leer una palabra del título.
Un elenco diluye justamente eso. Tres presentadores dividen el reconocimiento en tres y cada uno acumula un tercio de la exposición. Un canal con 50 videos publicados y un presentador entregó 50 impresiones del mismo rostro al mismo público. El mismo canal con tres presentadores entregó unas 17 de cada uno, por debajo del punto en que un espectador casual empieza a reconocer a alguien. El público no recuerda tres rostros de un canal que apenas conoce, recuerda ninguno.
Esto pesa más en los primeros 90 días, cuando el canal no tiene suscriptores, historial ni autoridad. Un canal nuevo necesita una cosa memorable, no tres cosas interesantes. Por eso el consejo estándar para un canal faceless nuevo es una sola voz y, si vas a usar avatar, un solo rostro, mantenido rígido hasta que el público demuestre que lo reconoce. El elenco es una mejora de formato que se compra después de que el reconocimiento existe, no una herramienta para crearlo.
En un canal manual esto ni siquiera es una decisión, es una restricción. Un presentador recurrente significa el mismo ser humano disponible la misma tarde, todas las semanas, para siempre. Dos presentadores significan dos agendas, dos honorarios y dos personas que tienen que aparecer. Y aun así la identidad se corre: un corte de pelo, otra luz, un fondo nuevo, una mala noche, y el rostro de la miniatura deja de coincidir con el rostro que la gente guardó.
En FalconVid esa deriva es una configuración de proyecto en vez de una batalla. El ADN del canal fija al presentador, el mismo rostro, la misma voz, el mismo estilo visual y el mismo ritmo, video tras video, así que esas 50 impresiones caen sobre un rostro idéntico y no sobre 50 variaciones leves. El presentador nunca está indisponible ni negocia, y por eso un canal automatizado puede sostener un presentador reconocible durante un año sin un solo problema de agenda.
Cuándo gana el elenco: hay formatos que no existen con una sola voz
Hay formatos que un narrador solo no puede producir sin que se derrumben en el tipo más plano de video explicativo. Una entrevista necesita a alguien preguntando y a alguien respondiendo. Un debate necesita dos posiciones defendidas por dos personas. Un noticiero necesita un presentador que encuadra y un reportero que detalla. Enseñar casi siempre necesita un alumno que haga la pregunta que el espectador tiene en la cabeza. Pregunta y respuesta necesita que la pregunta no salga de la misma boca que la respuesta.
El mecanismo de fondo es la retención, y es simple. Un cambio de voz es un reinicio de atención. En un explicativo de 12 minutos la atención del espectador cae de forma continua, y cada vez que cambia quien habla, el cerebro se reorienta para entender quién habla y por qué. Por eso los formatos de conversación sostienen audiencias durante horas mientras un monólogo sobre el mismo tema las pierde en seis minutos. Un intercambio cada 90 segundos da 8 reinicios a lo largo de un video de 12 minutos, repartidos justo donde la atención suele fugarse.
La parte importante, y la razón por la que esta sección no trata de avatares: esto funciona solo con voz. Cero rostros. Dos voces distintas intercambiando frases sobre escenas generadas y material de apoyo cuestan los mismos 288 créditos de narración premium que un narrador leyendo esos mismos 12 minutos, o 36 créditos en económico. Es la mejora de retención más barata disponible para un canal faceless, porque no cuesta nada. El elenco puede ser completamente invisible y aun así hacer la mayor parte del trabajo que la gente atribuye a los rostros.
Una advertencia que te salva de la peor versión de esto. El segundo personaje tiene que cumplir una función real, si no se vuelve ruido. Si la segunda voz existe solo para decir qué increíble, cuéntame más, agregaste una distracción, no un reinicio. El uso más afilado es darle a la segunda voz el escepticismo del propio espectador: el narrador afirma algo, el segundo personaje pregunta cómo lo sabes, y la respuesta cae más fuerte porque alguien dentro del video la exigió.
- Entrevista: un presentador pregunta, un especialista responde. Funciona solo con voz, cero segundos de rostro.
- Debate: dos posiciones defendibles sobre el mismo hecho, ideal para temas de comparación y polémica.
- Presentador y reportero: el presentador encuadra la historia, el reportero entrega el detalle.
- Profesor y alumno: el alumno hace exactamente la pregunta que el espectador está pensando.
- Pregunta y respuesta: 8 preguntas en 12 minutos son 8 reinicios de atención.
- Narrador más personaje citado: una segunda voz lee testimonios, citas y diálogos.
Cómo FalconVid maneja un elenco sin abrir un segundo presupuesto
El multipersonaje con voces distintas está activo en todos los planes. Toda función de creación de FalconVid está en todos los planes: lo que cambia entre planes es el volumen, cuántos canales llevas, cuántas generaciones corren a la vez, el Analista Sénior (desde Pro, con 7 días gratis en Starter) y el soporte. El guion recibe personajes, cada personaje recibe su propia voz del catálogo, incluidas voces premium Cartesia ultra realistas y clonación de voz si quieres una específica, y el video se sigue cobrando como un video de 12 minutos. Eso significa 1.008 créditos en modo económico, 8.676 en balanceado y 26.760 en premium, igual que si un solo narrador hubiera leído todo.
La identidad de cada personaje queda fijada por el ADN del canal, así que el presentador del video 12 sigue siendo el del video 40, con el mismo rostro, la misma voz y la misma firma visual. El rostro que cambia entre videos es la falla más común de los elencos de IA, porque un rostro regenerado desde un prompt cada semana es otra persona cada semana. Aquí es configuración persistente del proyecto, y eso permite al elenco acumular reconocimiento en vez de reiniciarlo en cada publicación.
Hay un lugar donde un rostro es barato, y conviene saberlo antes de planear cualquier cosa. El rostro de la miniatura se cobra como portada, 479 créditos en económico y 214 en premium, y no por segundo. La portada no tiene reloj corriendo, así que es la aplicación más barata posible de un avatar de IA en todo el canal. Un canal puede llevar un presentador visible y reconocible en cada portada y aun así tener cero segundos de avatar dentro del video.
Los subtítulos karaoke con CTAs vienen con el render, en más de 15 estilos, en todos los planes, y no tienen línea de crédito propia. Eso pesa más con elenco que con narrador único, porque los formatos de diálogo se consumen sin sonido mucho más que los monólogos, y el subtítulo es lo que mantiene legible un intercambio de dos voces cuando no hay audio. También es parte de por qué la mejora del diálogo cuesta cero de verdad: ni la voz extra ni los subtítulos suman una línea a la cuenta.
Alrededor de todo eso, la operación es igual a la de cualquier otro video. Apruebas un calendario una vez y especialistas de IA trabajan en paralelo sobre cada video, investigador, guionista, narrador, editor y diseño de sonido, con video listo en hasta 30 minutos y generaciones simultáneas de 2 a la vez en Starter hasta 50 en Scale. Antes de publicar abres Studio, ves la versión 1 y la ajustas: acortas la intro, cambias una escena o la música, o abres la línea de tiempo.
El diseño que cuesta poco y se lee como producción cara
El diseño que más aprovecha esta asimetría es directo. Mantén el elenco en las voces, donde es gratis, y mantén los rostros en cuatro dosis medidas: el gancho, las transiciones de capítulo, el veredicto y el cierre. Esas dosis suman cerca de 90 segundos en un video de 12 minutos, y los 11 minutos restantes los cargan escenas generadas, material de apoyo, gráficos y la narración que los personajes ya están haciendo. Rostro cuando el video hace una afirmación o un pedido, escenas cuando el video entrega información.
Con elenco distribuyes esas dosis en lugar de estirarlas. El presentador toma el gancho y el cierre, el segundo personaje toma una transición y el veredicto, o lo que el guion pida de verdad. El total de segundos de rostro en pantalla sigue en 90 y la línea de lip sync sigue en 2.880 créditos, porque las dosis se dividieron, no se sumaron. El espectador ve dos presentadores en el video y la cuenta ve el tiempo de pantalla de un solo presentador.
La única regla que protege el presupuesto es esta: nunca dejes que dos rostros ocupen el cuadro en el mismo instante durante esas dosis. Altérnalos. El corte de reacción, que es la respuesta por defecto de todo programa de entrevistas jamás hecho, muestra un rostro a la vez y por lo tanto corre un reloj a la vez. Y además se ve mejor, porque un rostro ocupando el cuadro entero tiene más presencia que dos medios rostros peleando por la misma atención.
Corre el mes y la diferencia se vuelve una decisión de negocio. En Pro de $97 con 30.000 créditos, los videos con elenco alternado a 3.888 créditos caben 7 veces. Los mismos videos con los dos presentadores compartiendo el cuadro a 6.768 créditos caben 4. Convertidos en cabezas parlantes enteras a 24.048 créditos, el mismo presupuesto cabe 1. Nadie corre un mes en una sola configuración, así que el plan realista es mezclar videos económicos a 1.008 créditos con algunos cargando la dosis de 90 segundos.
- Gancho de 8 a 15 segundos, transiciones de 5 a 8 segundos cada una, veredicto de 15 a 25, cierre de 10 a 15.
- Reparte las dosis entre los personajes en vez de sumar dosis: siguen siendo 90 segundos de rostro, 2.880 créditos.
- Los mismos 90 segundos con los dos rostros en el cuadro: 5.760 créditos, y el video pasa de 3.888 a 6.768.
- Resto del video: escena del banco 5 créditos, imagen económica 63, investigación más guion 307, tarifa base del pipeline 16.
- Subtítulos karaoke y CTAs: son parte del render, sin línea de crédito, en todos los planes.
La misma decisión, en un canal manual y en uno automatizado
En un canal manual, un elenco significa más gente delante de la cámara. Dos presentadores significan dos agendas que cuadrar, dos honorarios que pagar, dos días de grabación o un día en que ambos tienen que estar libres, dos tandas de repeticiones y dos personas cuya ausencia frena la publicación. Agrega un tercer personaje y el problema de coordinación crece más rápido que el contenido. Por eso casi ningún canal pequeño tiene elenco: no es una decisión creativa, es una decisión de nómina y logística, y la respuesta suele ser no.
En un canal automatizado la misma decisión cuesta casi nada tomarla. Un personaje es una decisión de guion. La voz extra sale gratis, porque la narración se cobra por minuto de video, así que 288 créditos de narración premium o 36 de narración económica cubren tantos personajes como pida el guion. El rostro es una dosis medida en segundos, 32 créditos cada uno con Kling Avatar Standard, y tú decides cuántos de esos segundos compras y qué personaje se los queda.
Y el mismo elenco corre en tantos canales y tantos idiomas como quieras. FalconVid escribe, narra, edita, subtitula y publica en YouTube, Instagram, TikTok, Rumble y Facebook en hasta 63 idiomas, y duplicar un proyecto a otro idioma cuesta solo la diferencia, así que una dupla de presentador y reportero construida una vez encabeza el canal en inglés, el de español y el de portugués sin ser reconstruida. Starter corre 1 canal, Pro corre 5, Business 10, Agency 25 y Scale no tiene límite de canales.
Así que la respuesta práctica se divide por etapa, no por gusto. Un canal nuevo debería sostener un solo presentador reconocible, usar un elenco de voces por la ganancia de retención y gastar sus segundos de rostro en el gancho y el cierre. Un canal establecido puede sumar un segundo personaje visible donde el formato lo pida, manteniendo los rostros alternando en vez de compartiendo el cuadro. En cualquier caso, la restricción que antes zanjaba esta discusión, si había un segundo ser humano disponible y pagable, ya no es la restricción.
