Serie AI-Native · Ingeniería inversa
Construye tu propio HeyGen con código abierto
Resumen de 1 minuto — qué te llevas
HeyGen es una empresa de video con IA con ~$100M de ARR. La desarmé módulo por módulo y mapeé cada pieza a su mejor reemplazo de código abierto — avatar, sincronización labial, voz, doblaje, tiempo real. Cada módulo tiene un equivalente OSS creíble, pero no existe un clon en un solo repositorio totalmente seguro para uso comercial, y los modelos que mejor suenan son no comerciales. El verdadero foso no es el modelo; es la capa de producto.
HeyGen es una empresa de video con IA con ~$100M de ARR, y sus avatares son genuinamente buenos. Así que hice lo que haría cualquier fundador: la fui desarmando pieza por pieza y me pregunté, para cada una, cuál es el mejor reemplazo de código abierto. La respuesta es alentadora y humillante al mismo tiempo.
Es un pipeline, no una caja mágica
Todo producto de "video con avatar con IA" es el mismo pipeline de seis etapas. Una vez que ves las etapas, HeyGen deja de ser un monolito y se convierte en una lista de compras:
- Síntesis de avatar — convertir una foto o video de referencia en una cabeza parlante.
- Sincronización labial — mover la boca a partir del audio.
- Voz / TTS — clonar o sintetizar la voz.
- Traducción / doblaje — localizar a otros idiomas, preservando la voz.
- Transmisión en tiempo real — hacer todo esto en vivo, con menos de un segundo de latencia.
- Orquestación — la app que conecta todo para un usuario no técnico.
El mapa módulo por módulo
| Módulo de HeyGen | Mejor OSS (comercialmente seguro) | Licencia | La brecha |
|---|---|---|---|
| Síntesis de avatar | MuseTalk, EchoMimicV2 | MIT / Apache | consistencia de cuerpo completo e identidad |
| Sincronización labial | LatentSync, MuseTalk | Apache / MIT | ángulos extremos de cabeza |
| Voz / TTS | GPT-SoVITS, F5-TTS, OpenVoice | MIT | los modelos que mejor suenan son no comerciales |
| Traducción / doblaje | faster-whisper + WhisperX + SoniTranslate | MIT / BSD / Apache | control de calidad en un clic vs. armarlo tú mismo |
| Streaming en tiempo real | LiveTalking (backend de MuseTalk) | Apache | latencia, costo de GPU, escalabilidad |
| Orquestación (completa) | HeyGem / Duix-Avatar | personalizada, sin licencia OSI | no existe un clon permisivo en un solo repositorio |
Conteos de estrellas y licencias verificados contra la API de GitHub el 2026-07-22. Las licencias cambian; verifica antes de construir.
Dos trampas que te van a morder
La trampa de la licencia. Los modelos con más forks y mejor sonido son justamente los que no puedes lanzar al mercado. Wav2Lip, la base clásica de sincronización labial, está entrenado con un dataset de uso exclusivamente académico. Los mejores clonadores de voz —fish-speech, Coqui XTTS-v2— son no comerciales, y Coqui cerró, así que no queda nadie a quien comprarle una licencia. Existe una ruta comercialmente segura (LatentSync, GPT-SoVITS, F5-TTS), pero es la segunda mejor en calidad de sonido, y lo que ahorraste ahí lo terminas gastando en ajustarla.
La trampa del producto. Puedes ensamblar todos los modelos gratis y aun así no tener HeyGen. La biblioteca de avatares, el editor de guiones, el ciclo de control de calidad del doblaje, la cola de renderizado, la capa de consentimiento y moderación, la organización de soporte: nada de eso es open source. Ese es el verdadero foso.
La defensibilidad de HeyGen no está en ningún modelo individual —cada módulo ya tiene un equivalente open-source creíble—. Está en la integración, el realismo en el margen, una API barata de pago por uso, y la capa de producto alrededor de los modelos. Si vas a construir en este espacio, no intentes superarlos en modelos. Supéralos en producto supéralos en producto en la porción angosta que ellos desatienden.
Cómo lo hice — y el marcador honesto de la herramienta que lo hizo
Corrí esto a través de un método de ingeniería inversa que he estado construyendo (repo privado, a propósito). La disciplina es la parte interesante: reunir solo evidencia pública, etiquetar cada afirmación como fact / inference / speculation, mantener un rastro de procedencia y nunca dejar que una inferencia se presente como un hecho. Mismo método sin importar si el objetivo es un producto, un paper o un mercado.
Después evalué la herramienta con honestidad, porque una herramienta de desarme que no resiste su propio desarme no es confiable. Lo que funcionó: navegó el sitio en vivo, mantuvo cada afirmación tipada y con fuente, e hizo cumplir sus propias compuertas (se niega a reproducir IP protegida sin visto bueno humano). Lo que falló — y esta es la parte útil: cuando la corrí por primera vez, reportó un 0.9680% de confianza. Demasiado alto. Había estado contando mis inferences sobre los mecanismos internos de HeyGen como si fueran facts. Arreglé eso para que el tipo de evidencia fluyera hacia el cálculo de confianza, la corrí de nuevo, y honestamente bajó a un 55%0.74. Un número más bajo pero más verdadero es de eso se trata.
La brecha honesta en ese momento: la herramienta era un sólido andamiaje de honestidad que todavía no hacía la ingeniería inversa por ti. Desde que redacté esto por primera vez, he cerrado la mayor parte de esa brecha. Ahora navega ella misma el objetivo en vivo, su cálculo de confianza respeta el tipo de evidencia por construcción y — la parte que importa aquí — produce por sí misma el mapa módulo por módulo de OSS de arriba, negándose a inventar un repositorio donde no existe ninguno (marca la capa de producto inclonable como un honesto "desconocido" en lugar de fabricar uno). La debilidad se convirtió en una funcionalidad, con los mismos comprobantes.
Qué sigue
El motor sigue siendo privado por ahora. Lo que está hecho: navegación en vivo, confianza tipada por evidencia, y mapeo nativo de módulo a OSS — el mapa de arriba se genera, no se construye a mano. Lo que falta: la descomposición completa impulsada por el modelo en el flujo por defecto, para que la herramienta proponga ella misma el desglose de módulos en vez de partir de uno que yo le paso. El objetivo no cambia: abaratar la producción de un análisis riguroso y respaldado por trazabilidad de evidencia, para cualquier objetivo.
Si estás decidiendo entre construir o comprar en video con IA: compra el realismo y la API, y construye la cuña de producto acotada. Los modelos ya son un commodity. El producto no.
AI-Native Series · Paul Jialiang Wu · love12xfuture · Solo fuentes públicas; sin afiliación con HeyGen. Análisis para comprensión e interoperabilidad, no para reproducir los modelos protegidos de nadie. Cifras con fecha 2026-07-22 y cambian rápido.