Paul Jialiang Wu agentic-portfolio English 中文 한국어 日本語✉️ Lista gratuita
← Volver al portafolio

Serie AI-Native · Ingeniería Agéntica

Mi cofundador con IA trabajó 48 horas seguidas. Los mejores momentos fueron sus negativas.

Resumen de 1 minuto — con qué te vas a quedar

Dos días, un humano, un cofundador con IA: un curso reconstruido en torno a la práctica real, canciones que enseñan, un espejo que baila, una plataforma de tutoría conectada y el primer dato real de aprendizaje (diversión: 4/5). Y lo que resultó ser la ventaja competitiva, sorprendentemente, no fue la velocidad — fue cada vez que el agente se negó a fingir un resultado.

Dos días construyendo en público con un agente que trata el "verificar" como una religión. Lanzamos seis cosas, rompimos dos, medimos a un humano — y resultó que la ventaja competitiva era la honestidad, no la velocidad.

48 hours: a loop diagram — build, verify, refuse to fake, ship — with a coffee cup marking the total API cost.

El martes le pedí a mi cofundador con IA que revisara un curso de formación. Un agente educado se habría limitado a corregir algunas erratas. El mío leyó las 22.740 palabras completas, calificó el curso como "un borrador sólido de notable, pero con un núcleo hueco" y señaló que el guion del presentador afirmaba "every example is a real session I ran" (Traducción: "cada ejemplo es una sesión real que ejecuté") — sobre ejemplos que jamás se habían ejecutado.

Luego hizo algo que he llegado a atesorar: se negó a dejar pasar esa frase.

Lo que siguió fueron 48 horas de la colaboración más extraña y más productiva de mi carrera. Aquí está el marcador honesto — incluidas las partes que se rompieron.

Las pruebas concretas (porque una historia sin números es solo una sensación)

EnviadoEvidencia
Un curso de conferencias reconstruido como programa de capacitación prácticaLa proporción entre "contar" y "hacer" pasó de 100:0 a 40:60; las transcripciones de demos fabricadas fueron reemplazadas por ejecuciones reales capturadas
Canciones que enseñan frameworksDos canciones pegadizas generadas con modelos abiertos de licencia limpia — un coro que deletrea cómo hacer prompts, un himno para el ciclo agéntico
Un "espejo mágico"Webcam → esqueleto → avatar luminoso que baila tu baile al ritmo de la música, ~200 líneas, todo local en el dispositivo
Una plataforma de tutoría, desplegada y conectadaColumna vertebral de código abierto (repositorio con 26 mil estrellas) corriendo localmente: base de conocimiento a partir de un paper real, generación de cuestionarios, telemetría de $0.0004 por turno
El primer dato real de un aprendizn=1 (yo): repetición explicativa completada, pulso de diversión 4/5, sonda de retención agendada para el día 7
Un examinador escéptico al que no se puede encantarGenera sondas de transferencia — escenarios inéditos, nunca parafraseos — y luego evalúa el mecanismo, no la fluidez. Prueba de oro: explicación profunda → "PASS"; palabrería fluida → "NOT_YET"
48 hours, six ships: Day 1 — course rebuilt into an enablement program, teaching songs, magic mirror, tutoring spine. Day 2 — the charter, a 110-agent verified research sweep, first learner data (n=1, fun 4/5), and the examiner that can't be charmed.

Costo total medido de API del sprint final — el examinador, una cadena de confiabilidad y una columna vertebral de datos: menos de $0.25. Menos que el café que tomé mientras lo veía trabajar.

Las negativas eran el producto

Todo el mundo hace demos de lo que su IA puede hacer. Las 48 horas me enseñaron que el valor está en lo que un agente bien enarnesado no hace:

Three refusals worth more than six ships: won't ship fiction, won't fake a score, won't hide an outage. An honest cross beats a fake check — as an exit code, not a slogan.

No presentaría ficción como si fuera un hecho. Las transcripciones de demostración del curso estaban "redactadas para parecer reales". El agente generó una sesión real en un repositorio real, capturó el plan real, el diff real de una línea, las pruebas reales en verde — y luego reescribió las diapositivas para que coincidieran con la realidad, que resultó ser menos dramática que la ficción, y por eso mismo más convincente. La versión fabricada mostraba a la IA arreglando heroicamente dos pruebas fallidas. ¿La ejecución real? Una competencia aburrida a la primera. Esa honestidad es ahora el momento inaugural de la clase.

No fingiría un ranking. Nuestro generador de canciones clasifica automáticamente las tomas según su adherencia al prompt. El modelo de clasificación no estaba instalado, así que el reporte decía "clasificado por la primera toma (CLAP no disponible)" en lugar de inventar un puntaje. Algo pequeño; y sin embargo, se acumula.

No ocultaría una falla. La noche de la demo, el motor de música alojado en la nube murió a mitad del piloto. En lugar de dejar un vacío silencioso, el agente registró la falla, construyó una cadena de resiliencia a la mañana siguiente (motor alojado → motor local → un honesto "no se pudo generar la canción — continuando sin ella"), y luego probó en vivo la cadena contra el servicio que seguía caído. La mejor prueba posible de degradación elegante es una falla real, y resultó que teníamos una a mano.

El patrón: un ❌ honesto vence a un ✅ falso — no como eslogan, sino como código de salida. Cada afirmación en nuestros repositorios ahora lleva evidencia o una etiqueta ⚪ de "sin comprobar". Resulta que la integridad se puede diseñar.

El giro inesperado de la ciencia

A mitad de camino, corrimos un barrido de investigación profunda (110 agentes, cada afirmación verificada de forma adversarial) sobre 30 años de ciencia del aprendizaje. Tres hallazgos reordenaron el rumbo del proyecto:

1. El número más famoso de la educación es un mito. El efecto de tutoría "2-sigma" de Bloom no se replica — la tutoría humana real tiene un d≈0.79, y los tutores de software ya lo igualan estadísticamente. La meta que todos han perseguido es un tercio de su leyenda, y las máquinas ya la alcanzaron en silencio.

2. Evaluar con lo mismo que se enseñó infla los resultados de 3 a 6 veces. Los sistemas de tutoría obtienen 0.73 en pruebas construidas con su propio material y 0.13 en pruebas de transferencia. Por eso nuestro examinador solo hace preguntas de escenario novedoso. Si tu producto de aprendizaje se califica a sí mismo la tarea, tus métricas son marketing.

3. Nadie ha medido la "diversión". Velocidad, profundidad, durabilidad: décadas de evidencia. ¿Y el eje de la alegría? Ni una sola afirmación verificada. Lo que significa que el conjunto de datos sobre diversión que empezamos a recolectar esta semana (tamaño de la muestra: un humano entusiasta, 4/5) es diminuto, honesto y, hasta donde podemos ver, casi el único que existe en el campo.

Qué debería sacar de esto un chico de 15 años

Un cofundador con IA no es un chatbot que habla más. Es un ciclo: meta → construir → verificar → negarse a fingir → aprender → repetir. Los pasos de "verificar" y "negarse" son donde se esconde todo el valor, porque son justo los pasos que los humanos nos saltamos cuando estamos cansados y que los agentes se saltan cuando están mal enarnesados. La ingeniería de arneses —contratos, compuertas, niveles de evidencia— es el oficio de convertir el camino honesto en el camino fácil.

build the thing
  → test it against reality (not against vibes)
  → when it fails, say so, loudly, in the log
  → bank the lesson where the next run will find it
  → repeat until the demo is just... true
The loop, animated: build, verify, refuse to fake, learn — a dot orbits the cycle and never skips verify. Repeat until the demo is just true.
Sí, el punto está animado. No, nunca se salta el "verificar". Ese es justamente el punto.

Dos días. Seis lanzamientos. Dos rupturas honestas, ambas convertidas ya en funciones estructurales. Un humano divirtiéndose de forma medible mientras aprende sobre la atención de los transformers. Y una sospecha creciente de que, en la era de los agentes, la confianza es la única demo que se acumula.


Todo aquí es real e inspeccionable: el curso, las canciones, el espejo, el examinador, el registro de decisiones fork por fork con su libro de ROI. Las herramientas están abiertas en github.com/wjlgatech.

Sigue leyendo

Parte de la serie AI-Native. Las herramientas están abiertas en github.com/wjlgatech: el botón de Publicar es tuyo.