Paul Jialiang Wu agentic-portfolio English 中文 한국어 日本語✉️ Lista gratuita
← Volver al portafolio

Serie AI-Native · Ingeniería inversa

Construye tu propio HeyGen con código abierto

Resumen de 1 minuto — qué te llevas

HeyGen es una empresa de video con IA con ~$100M de ARR. La desarmé módulo por módulo y mapeé cada pieza a su mejor reemplazo de código abierto — avatar, sincronización labial, voz, doblaje, tiempo real. Cada módulo tiene un equivalente OSS creíble, pero no existe un clon en un solo repositorio totalmente seguro para uso comercial, y los modelos que mejor suenan son no comerciales. El verdadero foso no es el modelo; es la capa de producto.

HeyGen es una empresa de video con IA con ~$100M de ARR, y sus avatares son genuinamente buenos. Así que hice lo que haría cualquier fundador: la fui desarmando pieza por pieza y me pregunté, para cada una, cuál es el mejor reemplazo de código abierto. La respuesta es alentadora y humillante al mismo tiempo.

Build your own HeyGen from open source — module map

Es un pipeline, no una caja mágica

Todo producto de "video con avatar con IA" es el mismo pipeline de seis etapas. Una vez que ves las etapas, HeyGen deja de ser un monolito y se convierte en una lista de compras:

  1. Síntesis de avatar — convertir una foto o video de referencia en una cabeza parlante.
  2. Sincronización labial — mover la boca a partir del audio.
  3. Voz / TTS — clonar o sintetizar la voz.
  4. Traducción / doblaje — localizar a otros idiomas, preservando la voz.
  5. Transmisión en tiempo real — hacer todo esto en vivo, con menos de un segundo de latencia.
  6. Orquestación — la app que conecta todo para un usuario no técnico.
HeyGen module to open-source equivalent, with the gaps
Cada módulo de HeyGen y su mejor equivalente open-source comercialmente seguro. Verde = licencia permisiva; rojo = la trampa.

El mapa módulo por módulo

Módulo de HeyGenMejor OSS (comercialmente seguro)LicenciaLa brecha
Síntesis de avatarMuseTalk, EchoMimicV2MIT / Apacheconsistencia de cuerpo completo e identidad
Sincronización labialLatentSync, MuseTalkApache / MITángulos extremos de cabeza
Voz / TTSGPT-SoVITS, F5-TTS, OpenVoiceMITlos modelos que mejor suenan son no comerciales
Traducción / doblajefaster-whisper + WhisperX + SoniTranslateMIT / BSD / Apachecontrol de calidad en un clic vs. armarlo tú mismo
Streaming en tiempo realLiveTalking (backend de MuseTalk)Apachelatencia, costo de GPU, escalabilidad
Orquestación (completa)HeyGem / Duix-Avatarpersonalizada, sin licencia OSIno existe un clon permisivo en un solo repositorio

Conteos de estrellas y licencias verificados contra la API de GitHub el 2026-07-22. Las licencias cambian; verifica antes de construir.

Dos trampas que te van a morder

La trampa de la licencia. Los modelos con más forks y mejor sonido son justamente los que no puedes lanzar al mercado. Wav2Lip, la base clásica de sincronización labial, está entrenado con un dataset de uso exclusivamente académico. Los mejores clonadores de voz —fish-speech, Coqui XTTS-v2— son no comerciales, y Coqui cerró, así que no queda nadie a quien comprarle una licencia. Existe una ruta comercialmente segura (LatentSync, GPT-SoVITS, F5-TTS), pero es la segunda mejor en calidad de sonido, y lo que ahorraste ahí lo terminas gastando en ajustarla.

La trampa del producto. Puedes ensamblar todos los modelos gratis y aun así no tener HeyGen. La biblioteca de avatares, el editor de guiones, el ciclo de control de calidad del doblaje, la cola de renderizado, la capa de consentimiento y moderación, la organización de soporte: nada de eso es open source. Ese es el verdadero foso.

La defensibilidad de HeyGen no está en ningún modelo individual —cada módulo ya tiene un equivalente open-source creíble—. Está en la integración, el realismo en el margen, una API barata de pago por uso, y la capa de producto alrededor de los modelos. Si vas a construir en este espacio, no intentes superarlos en modelos. Supéralos en producto supéralos en producto en la porción angosta que ellos desatienden.

Cómo lo hice — y el marcador honesto de la herramienta que lo hizo

Corrí esto a través de un método de ingeniería inversa que he estado construyendo (repo privado, a propósito). La disciplina es la parte interesante: reunir solo evidencia pública, etiquetar cada afirmación como fact / inference / speculation, mantener un rastro de procedencia y nunca dejar que una inferencia se presente como un hecho. Mismo método sin importar si el objetivo es un producto, un paper o un mercado.

Después evalué la herramienta con honestidad, porque una herramienta de desarme que no resiste su propio desarme no es confiable. Lo que funcionó: navegó el sitio en vivo, mantuvo cada afirmación tipada y con fuente, e hizo cumplir sus propias compuertas (se niega a reproducir IP protegida sin visto bueno humano). Lo que falló — y esta es la parte útil: cuando la corrí por primera vez, reportó un 0.9680% de confianza. Demasiado alto. Había estado contando mis inferences sobre los mecanismos internos de HeyGen como si fueran facts. Arreglé eso para que el tipo de evidencia fluyera hacia el cálculo de confianza, la corrí de nuevo, y honestamente bajó a un 55%0.74. Un número más bajo pero más verdadero es de eso se trata.

La brecha honesta en ese momento: la herramienta era un sólido andamiaje de honestidad que todavía no hacía la ingeniería inversa por ti. Desde que redacté esto por primera vez, he cerrado la mayor parte de esa brecha. Ahora navega ella misma el objetivo en vivo, su cálculo de confianza respeta el tipo de evidencia por construcción y — la parte que importa aquí — produce por sí misma el mapa módulo por módulo de OSS de arriba, negándose a inventar un repositorio donde no existe ninguno (marca la capa de producto inclonable como un honesto "desconocido" en lugar de fabricar uno). La debilidad se convirtió en una funcionalidad, con los mismos comprobantes.

Qué sigue

El motor sigue siendo privado por ahora. Lo que está hecho: navegación en vivo, confianza tipada por evidencia, y mapeo nativo de módulo a OSS — el mapa de arriba se genera, no se construye a mano. Lo que falta: la descomposición completa impulsada por el modelo en el flujo por defecto, para que la herramienta proponga ella misma el desglose de módulos en vez de partir de uno que yo le paso. El objetivo no cambia: abaratar la producción de un análisis riguroso y respaldado por trazabilidad de evidencia, para cualquier objetivo.

Si estás decidiendo entre construir o comprar en video con IA: compra el realismo y la API, y construye la cuña de producto acotada. Los modelos ya son un commodity. El producto no.


AI-Native Series · Paul Jialiang Wu · love12xfuture · Solo fuentes públicas; sin afiliación con HeyGen. Análisis para comprensión e interoperabilidad, no para reproducir los modelos protegidos de nadie. Cifras con fecha 2026-07-22 y cambian rápido.