Blog

Elenco de avatares de IA o un solo presentador: la segunda voz sale gratis, el segundo rostro tiene taxímetro

La narración se cobra por minuto de video, no por voz, así que seis personajes cuestan exactamente lo que cuesta un narrador. El lip sync se cobra por segundo de rostro en pantalla, así que cada rostro visible corre su propio reloj. Un video de 12 minutos con 90 segundos de un rostro cuesta 3.888 créditos. Los mismos 90 segundos con dos rostros compartiendo el cuadro cuestan 6.768.

Ricardo AlmeidaFundador18 min de lectura
Una cabeza dorada de malla rodeada por un anillo de cronómetro junto a tres cabezas apagadas unidas por ondas de sonido y sin ningún anillo.

Dos reglas de cobro, y apuntan hacia lados opuestos

Todo el mundo llega a esta pregunta con el mismo instinto: un elenco debe ser caro, porque más personajes significan más trabajo y más cuenta. Dentro del motor pasa lo contrario, por una razón muy concreta. La narración se cobra por minuto de video terminado. El lip sync se cobra por segundo de rostro en pantalla. Esas dos unidades deciden el formato antes de cualquier discusión de gusto.

Empieza por la narración. En un video de 12 minutos, la voz premium cuesta 24 créditos por minuto, lo que da 288 créditos en el video entero, unos $0,90 con el crédito valiendo $0,003133. La voz económica cuesta 3 créditos por minuto, o sea 36 créditos en esos mismos 12 minutos, unos $0,11. Ahora fíjate en lo que falta en esa fórmula: la cantidad de voces. Un narrador solo o seis personajes intercambiando frases, siguen siendo 12 minutos de video y siguen siendo 288 créditos en voz premium.

Ahora el lip sync, que es lo que un avatar de IA es en realidad. Se cobra por segundo de rostro en pantalla, porque cada uno de esos segundos es una generación. Kling Avatar Standard cuesta 32 créditos por segundo, unos $6,02 por minuto de rostro. Kling Avatar Pro cuesta 64 por segundo, unos $12,03 por minuto. HeyGen cuesta 80 por segundo, unos $15,04 por minuto. OmniHuman 1.5 cuesta 112 por segundo, unos $21,05 por minuto. No hay licencia por personaje ni mensualidad por avatar. Lo que compras es tiempo de pantalla.

Aquí está la equivalencia que vuelve concreta la asimetría. Nueve segundos de un segundo rostro en pantalla con Kling Avatar Standard cuestan 288 créditos. Es exactamente lo que cuesta narrar los 12 minutos completos en voz premium, para todos los personajes del guion, sean los que sean. Nueve segundos de un rostro visible de más equivalen a doce minutos de todas las voces que quieras. Al revés: poco más de un segundo de ese mismo rostro cuesta 36 créditos, el precio de narrar el video entero con la voz económica.

Así que la frase honesta, la que debería guiar la decisión de formato, es esta. El diálogo es casi gratis y el elenco visible no lo es. Escribir cuatro personajes en un guion suma cero créditos a la línea de narración. Mostrar cuatro rostros suma 32 créditos por segundo, por rostro, mientras sigan en el cuadro. Todo lo demás en este artículo es consecuencia de esa única asimetría.

La aritmética del elenco: no son los personajes, son los rostros simultáneos

Empieza por la base. Un video de 12 minutos en modo económico cuesta 1.008 créditos, unos $3,16. Suma 90 segundos de rostro con Kling Avatar Standard y sumas 90 por 32, que dan 2.880 créditos, unos $9,02. El video cierra en 3.888 créditos, unos $12,18. Ese es el número de referencia del formato con presentador único, y toda comparación de abajo se mide contra él.

Ahora pon dos avatares en el mismo video, alternando, nunca juntos en el cuadro. Un presentador toma 45 segundos y un reportero toma 45 segundos. Cuenta los segundos de rostro que de verdad aparecen en pantalla: siguen siendo 90, porque solo hay un rostro a la vez. La línea de lip sync sigue en 2.880 créditos y el video sigue cerrando en 3.888. El segundo personaje, con nombre propio, voz propia e identidad visual propia, sumó exactamente cero créditos a la cuenta.

Ahora pon esos mismos dos avatares en el mismo cuadro durante esos mismos 90 segundos, en pantalla dividida o en un plano de dos. Dos relojes corren a la vez. El motor genera 180 segundos de rostro, así que la línea de lip sync se vuelve 5.760 créditos y el video cierra en 6.768, unos $21,20. Mismo guion, mismos dos personajes, los mismos 90 segundos de pantalla, y la cuenta subió 74 por ciento.

Para el extremo del rango, toma la cabeza parlante entera: 12 minutos de rostro, que son 720 segundos. Con Kling Avatar Standard eso da 23.040 créditos, así que el video cierra en 24.048, unos $75,34. Es 6,2 veces la versión con elenco alternado del mismo contenido exacto, y por eso la decisión de formato vale más que cualquier ajuste que hagas al guion.

La regla que sale de ahí es corta y es el artículo entero. Un elenco no se encarece por tener más personajes. Se encarece por tener más rostro en pantalla al mismo tiempo. El corte de reacción y el plano alternado son el formato barato. La pantalla dividida es el caro. Y resulta ser la misma gramática de edición que todo programa de entrevistas bien hecho usa desde hace décadas, así que la opción barata también es la que parece más profesional.

  • Video de 12 minutos en modo económico: 1.008 créditos, unos $3,16.
  • Un presentador, 90 segundos de rostro con Kling Avatar Standard: 2.880 créditos, total de 3.888.
  • Dos presentadores alternando, los mismos 90 segundos en pantalla: los mismos 3.888 créditos.
  • Dos presentadores compartiendo el cuadro, 90 segundos: 180 segundos de rostro, 5.760 créditos, total de 6.768.
  • Cabeza parlante entera de 12 minutos: 720 segundos de rostro, 24.048 créditos, unos $75,34.
Dos cabezas doradas de malla lado a lado, cada una rodeada por su propio anillo de cronómetro girando, con una tercera cabeza apagada al fondo sin anillo.

Cuándo gana el presentador único: el reconocimiento se construye repitiendo

El argumento más fuerte a favor de un solo presentador no tiene nada que ver con créditos. Es el reconocimiento. Quien está bajando por el feed decide el clic en bastante menos de un segundo, y dentro de esa ventana un rostro familiar es una señal más fuerte que cualquier titular. Después de 30 o 40 videos con el mismo presentador, ese rostro deja de ser una elección de diseño y se vuelve el logo del canal. La gente lo reconoce en la miniatura antes de leer una palabra del título.

Un elenco diluye justamente eso. Tres presentadores dividen el reconocimiento en tres y cada uno acumula un tercio de la exposición. Un canal con 50 videos publicados y un presentador entregó 50 impresiones del mismo rostro al mismo público. El mismo canal con tres presentadores entregó unas 17 de cada uno, por debajo del punto en que un espectador casual empieza a reconocer a alguien. El público no recuerda tres rostros de un canal que apenas conoce, recuerda ninguno.

Esto pesa más en los primeros 90 días, cuando el canal no tiene suscriptores, historial ni autoridad. Un canal nuevo necesita una cosa memorable, no tres cosas interesantes. Por eso el consejo estándar para un canal faceless nuevo es una sola voz y, si vas a usar avatar, un solo rostro, mantenido rígido hasta que el público demuestre que lo reconoce. El elenco es una mejora de formato que se compra después de que el reconocimiento existe, no una herramienta para crearlo.

En un canal manual esto ni siquiera es una decisión, es una restricción. Un presentador recurrente significa el mismo ser humano disponible la misma tarde, todas las semanas, para siempre. Dos presentadores significan dos agendas, dos honorarios y dos personas que tienen que aparecer. Y aun así la identidad se corre: un corte de pelo, otra luz, un fondo nuevo, una mala noche, y el rostro de la miniatura deja de coincidir con el rostro que la gente guardó.

En FalconVid esa deriva es una configuración de proyecto en vez de una batalla. El ADN del canal fija al presentador, el mismo rostro, la misma voz, el mismo estilo visual y el mismo ritmo, video tras video, así que esas 50 impresiones caen sobre un rostro idéntico y no sobre 50 variaciones leves. El presentador nunca está indisponible ni negocia, y por eso un canal automatizado puede sostener un presentador reconocible durante un año sin un solo problema de agenda.

Cuándo gana el elenco: hay formatos que no existen con una sola voz

Hay formatos que un narrador solo no puede producir sin que se derrumben en el tipo más plano de video explicativo. Una entrevista necesita a alguien preguntando y a alguien respondiendo. Un debate necesita dos posiciones defendidas por dos personas. Un noticiero necesita un presentador que encuadra y un reportero que detalla. Enseñar casi siempre necesita un alumno que haga la pregunta que el espectador tiene en la cabeza. Pregunta y respuesta necesita que la pregunta no salga de la misma boca que la respuesta.

El mecanismo de fondo es la retención, y es simple. Un cambio de voz es un reinicio de atención. En un explicativo de 12 minutos la atención del espectador cae de forma continua, y cada vez que cambia quien habla, el cerebro se reorienta para entender quién habla y por qué. Por eso los formatos de conversación sostienen audiencias durante horas mientras un monólogo sobre el mismo tema las pierde en seis minutos. Un intercambio cada 90 segundos da 8 reinicios a lo largo de un video de 12 minutos, repartidos justo donde la atención suele fugarse.

La parte importante, y la razón por la que esta sección no trata de avatares: esto funciona solo con voz. Cero rostros. Dos voces distintas intercambiando frases sobre escenas generadas y material de apoyo cuestan los mismos 288 créditos de narración premium que un narrador leyendo esos mismos 12 minutos, o 36 créditos en económico. Es la mejora de retención más barata disponible para un canal faceless, porque no cuesta nada. El elenco puede ser completamente invisible y aun así hacer la mayor parte del trabajo que la gente atribuye a los rostros.

Una advertencia que te salva de la peor versión de esto. El segundo personaje tiene que cumplir una función real, si no se vuelve ruido. Si la segunda voz existe solo para decir qué increíble, cuéntame más, agregaste una distracción, no un reinicio. El uso más afilado es darle a la segunda voz el escepticismo del propio espectador: el narrador afirma algo, el segundo personaje pregunta cómo lo sabes, y la respuesta cae más fuerte porque alguien dentro del video la exigió.

  • Entrevista: un presentador pregunta, un especialista responde. Funciona solo con voz, cero segundos de rostro.
  • Debate: dos posiciones defendibles sobre el mismo hecho, ideal para temas de comparación y polémica.
  • Presentador y reportero: el presentador encuadra la historia, el reportero entrega el detalle.
  • Profesor y alumno: el alumno hace exactamente la pregunta que el espectador está pensando.
  • Pregunta y respuesta: 8 preguntas en 12 minutos son 8 reinicios de atención.
  • Narrador más personaje citado: una segunda voz lee testimonios, citas y diálogos.

Cómo FalconVid maneja un elenco sin abrir un segundo presupuesto

El multipersonaje con voces distintas está activo en todos los planes. Toda función de creación de FalconVid está en todos los planes: lo que cambia entre planes es el volumen, cuántos canales llevas, cuántas generaciones corren a la vez, el Analista Sénior (desde Pro, con 7 días gratis en Starter) y el soporte. El guion recibe personajes, cada personaje recibe su propia voz del catálogo, incluidas voces premium Cartesia ultra realistas y clonación de voz si quieres una específica, y el video se sigue cobrando como un video de 12 minutos. Eso significa 1.008 créditos en modo económico, 8.676 en balanceado y 26.760 en premium, igual que si un solo narrador hubiera leído todo.

La identidad de cada personaje queda fijada por el ADN del canal, así que el presentador del video 12 sigue siendo el del video 40, con el mismo rostro, la misma voz y la misma firma visual. El rostro que cambia entre videos es la falla más común de los elencos de IA, porque un rostro regenerado desde un prompt cada semana es otra persona cada semana. Aquí es configuración persistente del proyecto, y eso permite al elenco acumular reconocimiento en vez de reiniciarlo en cada publicación.

Hay un lugar donde un rostro es barato, y conviene saberlo antes de planear cualquier cosa. El rostro de la miniatura se cobra como portada, 479 créditos en económico y 214 en premium, y no por segundo. La portada no tiene reloj corriendo, así que es la aplicación más barata posible de un avatar de IA en todo el canal. Un canal puede llevar un presentador visible y reconocible en cada portada y aun así tener cero segundos de avatar dentro del video.

Los subtítulos karaoke con CTAs vienen con el render, en más de 15 estilos, en todos los planes, y no tienen línea de crédito propia. Eso pesa más con elenco que con narrador único, porque los formatos de diálogo se consumen sin sonido mucho más que los monólogos, y el subtítulo es lo que mantiene legible un intercambio de dos voces cuando no hay audio. También es parte de por qué la mejora del diálogo cuesta cero de verdad: ni la voz extra ni los subtítulos suman una línea a la cuenta.

Alrededor de todo eso, la operación es igual a la de cualquier otro video. Apruebas un calendario una vez y especialistas de IA trabajan en paralelo sobre cada video, investigador, guionista, narrador, editor y diseño de sonido, con video listo en hasta 30 minutos y generaciones simultáneas de 2 a la vez en Starter hasta 50 en Scale. Antes de publicar abres Studio, ves la versión 1 y la ajustas: acortas la intro, cambias una escena o la música, o abres la línea de tiempo.

El diseño que cuesta poco y se lee como producción cara

El diseño que más aprovecha esta asimetría es directo. Mantén el elenco en las voces, donde es gratis, y mantén los rostros en cuatro dosis medidas: el gancho, las transiciones de capítulo, el veredicto y el cierre. Esas dosis suman cerca de 90 segundos en un video de 12 minutos, y los 11 minutos restantes los cargan escenas generadas, material de apoyo, gráficos y la narración que los personajes ya están haciendo. Rostro cuando el video hace una afirmación o un pedido, escenas cuando el video entrega información.

Con elenco distribuyes esas dosis en lugar de estirarlas. El presentador toma el gancho y el cierre, el segundo personaje toma una transición y el veredicto, o lo que el guion pida de verdad. El total de segundos de rostro en pantalla sigue en 90 y la línea de lip sync sigue en 2.880 créditos, porque las dosis se dividieron, no se sumaron. El espectador ve dos presentadores en el video y la cuenta ve el tiempo de pantalla de un solo presentador.

La única regla que protege el presupuesto es esta: nunca dejes que dos rostros ocupen el cuadro en el mismo instante durante esas dosis. Altérnalos. El corte de reacción, que es la respuesta por defecto de todo programa de entrevistas jamás hecho, muestra un rostro a la vez y por lo tanto corre un reloj a la vez. Y además se ve mejor, porque un rostro ocupando el cuadro entero tiene más presencia que dos medios rostros peleando por la misma atención.

Corre el mes y la diferencia se vuelve una decisión de negocio. En Pro de $97 con 30.000 créditos, los videos con elenco alternado a 3.888 créditos caben 7 veces. Los mismos videos con los dos presentadores compartiendo el cuadro a 6.768 créditos caben 4. Convertidos en cabezas parlantes enteras a 24.048 créditos, el mismo presupuesto cabe 1. Nadie corre un mes en una sola configuración, así que el plan realista es mezclar videos económicos a 1.008 créditos con algunos cargando la dosis de 90 segundos.

  • Gancho de 8 a 15 segundos, transiciones de 5 a 8 segundos cada una, veredicto de 15 a 25, cierre de 10 a 15.
  • Reparte las dosis entre los personajes en vez de sumar dosis: siguen siendo 90 segundos de rostro, 2.880 créditos.
  • Los mismos 90 segundos con los dos rostros en el cuadro: 5.760 créditos, y el video pasa de 3.888 a 6.768.
  • Resto del video: escena del banco 5 créditos, imagen económica 63, investigación más guion 307, tarifa base del pipeline 16.
  • Subtítulos karaoke y CTAs: son parte del render, sin línea de crédito, en todos los planes.

La misma decisión, en un canal manual y en uno automatizado

En un canal manual, un elenco significa más gente delante de la cámara. Dos presentadores significan dos agendas que cuadrar, dos honorarios que pagar, dos días de grabación o un día en que ambos tienen que estar libres, dos tandas de repeticiones y dos personas cuya ausencia frena la publicación. Agrega un tercer personaje y el problema de coordinación crece más rápido que el contenido. Por eso casi ningún canal pequeño tiene elenco: no es una decisión creativa, es una decisión de nómina y logística, y la respuesta suele ser no.

En un canal automatizado la misma decisión cuesta casi nada tomarla. Un personaje es una decisión de guion. La voz extra sale gratis, porque la narración se cobra por minuto de video, así que 288 créditos de narración premium o 36 de narración económica cubren tantos personajes como pida el guion. El rostro es una dosis medida en segundos, 32 créditos cada uno con Kling Avatar Standard, y tú decides cuántos de esos segundos compras y qué personaje se los queda.

Y el mismo elenco corre en tantos canales y tantos idiomas como quieras. FalconVid escribe, narra, edita, subtitula y publica en YouTube, Instagram, TikTok, Rumble y Facebook en hasta 63 idiomas, y duplicar un proyecto a otro idioma cuesta solo la diferencia, así que una dupla de presentador y reportero construida una vez encabeza el canal en inglés, el de español y el de portugués sin ser reconstruida. Starter corre 1 canal, Pro corre 5, Business 10, Agency 25 y Scale no tiene límite de canales.

Así que la respuesta práctica se divide por etapa, no por gusto. Un canal nuevo debería sostener un solo presentador reconocible, usar un elenco de voces por la ganancia de retención y gastar sus segundos de rostro en el gancho y el cierre. Un canal establecido puede sumar un segundo personaje visible donde el formato lo pida, manteniendo los rostros alternando en vez de compartiendo el cuadro. En cualquier caso, la restricción que antes zanjaba esta discusión, si había un segundo ser humano disponible y pagable, ya no es la restricción.

Dudas

¿Preguntas? Tenemos respuestas.

¿Agregar un segundo personaje encarece el video?

En la línea de narración, no. La narración se cobra por minuto de video, no por voz, así que un video de 12 minutos cuesta 288 créditos en voz premium o 36 en económica tenga un narrador o seis personajes. El costo extra solo aparece si el segundo personaje tiene rostro visible, porque el lip sync se cobra por segundo de rostro en pantalla.

¿Cuánto cuesta de verdad un segundo rostro en pantalla?

32 créditos por segundo con Kling Avatar Standard, 64 con Kling Avatar Pro, 80 con HeyGen y 112 con OmniHuman 1.5. Para hacerlo concreto, 9 segundos de un segundo rostro con Kling Standard cuestan 288 créditos, que es exactamente lo que cuesta narrar los 12 minutos completos en voz premium para todos los personajes del guion.

¿Dos avatares alternando cuestan más que uno solo?

No. Lo que se cobra es el tiempo de rostro en pantalla, así que si dos personajes alternan y solo uno aparece a la vez, 90 segundos de rostro siguen siendo 90 segundos. Un video económico de 12 minutos con esa dosis cuesta 3.888 créditos de las dos formas. Pon los dos rostros juntos en el cuadro durante esos mismos 90 segundos y corren dos relojes a la vez, lo que lleva la cuenta a 6.768.

¿Presentador único o elenco para un canal nuevo?

Un solo presentador visible, con tantas voces como pida el formato. El reconocimiento se construye repitiendo, y 50 videos con un rostro entregan 50 impresiones de ese rostro, mientras que tres presentadores entregan unas 17 cada uno, por debajo del punto en que alguien empieza a reconocer a alguien. Suma elenco visible después de que el público ya conoce el canal.

¿Tengo que aparecer en cámara para hacer formato de diálogo?

No. Un canal faceless corre una entrevista o un debate de dos voces con cero rostros en pantalla, porque la ganancia de retención viene del cambio de voz, no de la imagen. Si quieres rostro igual, el lugar más barato es la miniatura, que se cobra como portada a 479 créditos en económico y 214 en premium, sin reloj por segundo.

¿Tengo que editar el video para que los personajes alternen bien?

No. Apruebas un calendario una vez y FalconVid escribe, narra, edita, subtitula, arma la miniatura y publica solo, con los personajes colocados donde el guion los pide. Si una dosis queda larga o una escena sale mal, abres Studio, ves la versión 1 y acortas la intro, cambias el material o cambias la música antes de que salga al aire.

¿El multipersonaje está bloqueado en un plan más caro?

No. El multipersonaje con voces distintas está activo en todos los planes, porque toda función de creación de FalconVid está en todos los planes: lo que cambia es el volumen, los canales, las generaciones simultáneas, el Analista Sénior (desde Pro, 7 días gratis en Starter) y el soporte. Starter de $47 con 15.000 créditos da unos 10 a 12 videos al mes mezclando el modo económico con uno en balanceado, y un video de 12 minutos cuesta 1.008 créditos en económico, 8.676 en balanceado y 26.760 en premium.

¿Cuántos videos con elenco caben en cada plan?

Con elenco alternado a 3.888 créditos por video económico de 12 minutos con 90 segundos de rostro: 3 en Starter de $47, 7 en Pro de $97, 24 en Business de $297, 48 en Agency de $597 y 82 en Scale de $997. Con los dos rostros compartiendo el cuadro a 6.768 créditos queda en 2, 4, 14, 28 y 47. Los packs que no caducan completan cualquiera: 2.000 por $9, 6.000 por $24 o 14.000 por $49.

Dale al canal un elenco entero y paga el tiempo de pantalla de un solo presentador

FalconVid investiga, escribe, narra, edita, subtitula y publica en YouTube, Instagram, TikTok, Rumble y Facebook en hasta 63 idiomas, desde un calendario que apruebas una sola vez, con especialistas de IA trabajando en paralelo y video listo en hasta 30 minutos. El multipersonaje con voces distintas está activo en todos los planes, así que las voces extra no cuestan nada en la línea de narración, y el ADN del canal fija cada rostro para que un elenco acumule reconocimiento en lugar de reiniciarlo cada semana. Un video de 12 minutos cuesta 1.008 créditos en modo económico, 8.676 en balanceado y 26.760 en premium. El Starter, $47 con 15.000 créditos, 1 canal y 2 generaciones simultáneas, da unos 10 a 12 videos al mes mezclando el económico con uno en balanceado. El Pro es $97 con 30.000 créditos, 5 canales y 5 generaciones simultáneas, hasta el Scale, $997 con 320.000 créditos, 50 canales y 50 generaciones simultáneas. Toda función de creación en todos los planes, prueba de 7 días con 2.000 créditos y garantía de 7 días.

Crear mi canal ahora

Cobro inmediato · Garantía de 7 días · Cancela cuando quieras

Sigue leyendo