Leer en: English | Español | Italiano
La charla de Andrej Karpathy “Intro to Large Language Models” es una de las conferencias sobre IA más vistas en YouTube — y con razón. En poco más de una hora, el ex jefe de IA en Tesla y miembro fundador de OpenAI desgrana todo lo que necesitas saber sobre cómo funcionan los LLMs, desde el entrenamiento hasta el uso de herramientas y los riesgos de seguridad.
Solo hay un problema: dura más de una hora. No todo el mundo tiene tiempo para verla entera.
Así que hicimos algo sencillo. Pegamos el enlace de YouTube en YouTube2Text y obtuvimos la transcripción completa — 12.151 palabras en 1.704 segmentos — en segundos. Sin registro, sin muro de pago, sin fricción. Luego usamos la transcripción para crear el resumen a continuación.
Esto solo es posible con YouTube2Text. Obtener una transcripción limpia, completa y lista para copiar de cualquier video de YouTube — al instante y gratis — es exactamente para lo que se creó esta herramienta. Ya seas estudiante de IA, desarrollador al día con el campo o creador de contenido reutilizando charlas, YouTube2Text convierte horas de video en texto buscable y citable.
Resumen: Intro to Large Language Models de Andrej Karpathy
¿Qué es realmente un LLM?
Karpathy abre con un enfoque bellamente simple: un modelo de lenguaje grande son solo dos archivos. Usando Llama 2 70B de Meta como ejemplo, explica que un archivo contiene 140 GB de parámetros de red neuronal (los “pesos”), y el otro son unas 500 líneas de código C que ejecutan esos parámetros. Eso es todo. Puedes poner ambos archivos en un MacBook y hablar con el modelo sin conexión a internet.
Entrenar = comprimir internet
La verdadera complejidad no está en ejecutar un modelo — está en crear esos parámetros. Entrenar Llama 2 70B requirió aproximadamente 10 terabytes de texto de internet, 6.000 GPUs durante 12 días y unos 2 millones de dólares en computación. Karpathy lo enmarca como compresión con pérdida: estás comprimiendo el conocimiento de internet en un archivo de 140 GB con una compresión de aproximadamente 100x. No es un archivo zip — el modelo no almacena copias exactas del texto. En su lugar, captura la esencia de los datos de entrenamiento.
¿Y estos números? “Números de principiante” según los estándares actuales, apunta. Los modelos de vanguardia como GPT-4 o Claude cuestan 10 veces más o más.
La predicción de la siguiente palabra es secretamente poderosa
La tarea central de cada LLM es engañosamente simple: predecir la siguiente palabra en una secuencia. Pero Karpathy argumenta que este objetivo es mucho más poderoso de lo que parece. Para predecir la siguiente palabra con precisión, el modelo debe aprender hechos sobre el mundo — nombres, fechas, relaciones, ciencia, código. Todo este conocimiento se comprime en los parámetros de la red durante el entrenamiento.
Cuando dejas que un modelo entrenado genere libremente, “sueña” documentos de internet — produciendo texto que parece código Java, listados de productos de Amazon o artículos de Wikipedia. El contenido es plausible pero a menudo alucinado. Un número ISBN puede parecer real pero probablemente no existe.
De soñador de documentos a asistente útil
Karpathy explica el pipeline de dos etapas detrás de modelos como ChatGPT:
- Pre-entrenamiento: Entrenar con texto masivo de internet. Esto construye conocimiento. Cantidad sobre calidad.
- Ajuste fino: Entrenar con conversaciones de preguntas y respuestas cuidadosamente curadas, escritas por etiquetadores humanos. Esto enseña al modelo a ser un asistente útil. Calidad sobre cantidad — quizás solo 100.000 ejemplos, pero cada uno elaborado a mano.
El resultado es un modelo que responde al estilo de un asistente útil mientras recurre al vasto conocimiento adquirido durante el pre-entrenamiento. Karpathy llama a esta segunda etapa “alineamiento”.
Leyes de escalado: el camino garantizado hacia mejores modelos
Uno de los puntos más sorprendentes de la charla: el rendimiento de los LLMs es una función notablemente suave y predecible de solo dos variables — el número de parámetros (N) y la cantidad de datos de entrenamiento (D). Modelo más grande + más datos = mejor rendimiento, casi garantizado. Sin avances algorítmicos necesarios.
Esto es lo que impulsa la fiebre del oro de las GPUs. Las empresas no apuestan por investigación arriesgada — invierten en computación porque las curvas de escalado les dan confianza en que más computación significa mejores modelos.
El uso de herramientas lo cambia todo
Karpathy muestra una demo en vivo donde ChatGPT investiga las rondas de financiación de Scale AI navegando por la web, calcula valoraciones usando un intérprete de código, genera un gráfico profesional con matplotlib, extrapola tendencias de crecimiento e incluso genera una imagen de la empresa — todo desde instrucciones en lenguaje natural.
La idea clave: los LLMs ya no solo “piensan en su cabeza”. Usan herramientas — navegadores, calculadoras, intérpretes de código, generadores de imágenes — igual que los humanos.
Multimodalidad: ver, oír, hablar
Los LLMs modernos ahora pueden procesar imágenes (convertir un boceto de sitio web dibujado a mano en HTML/JS funcional), generar imágenes mediante herramientas como DALL-E, e incluso participar en conversaciones de voz a voz — “como la película Her”, según Karpathy.
Pensamiento Sistema 1 vs. Sistema 2
Citando el marco de Daniel Kahneman, Karpathy señala que los LLMs actuales solo tienen pensamiento “Sistema 1” — rápido, instintivo, automático. Aún no pueden hacer pensamiento “Sistema 2” — razonamiento lento y deliberado como analizar una posición de ajedrez o un problema matemático complejo. Esta es un área de investigación activa.
Seguridad de LLMs: una nueva superficie de ataque
La sección final cubre amenazas emergentes:
- Ataques de jailbreak: Prompts adversarios que evitan el entrenamiento de seguridad, incluyendo “ataques de transferencia universal” que usan cadenas de texto sin sentido optimizadas para desbloquear comportamiento restringido.
- Inyección de prompts: Instrucciones ocultas en imágenes o páginas web que secuestran el modelo — como un texto blanco sobre blanco en una imagen diciéndole a ChatGPT que mencione una oferta falsa.
- Envenenamiento de datos: Insertar frases desencadenantes en los datos de entrenamiento que corrompen el comportamiento del modelo cuando se activan — un ataque de “agente durmiente” para IA.
Karpathy describe esto como un juego del gato y el ratón similar a la ciberseguridad tradicional, señalando que el campo es muy nuevo y evoluciona rápidamente.
Pruébalo tú mismo
Todo este resumen se creó a partir de una transcripción obtenida en segundos usando YouTube2Text. Pega cualquier URL de YouTube, obtén la transcripción completa al instante — con marcas de tiempo, conteo de palabras y copia con un clic o descarga. Sin cuenta necesaria.
Ya sea que estés resumiendo conferencias, investigando contenido, creando apuntes de estudio o construyendo datasets, YouTube2Text te da el texto que necesitas de cualquier video de YouTube. Pruébalo ahora →
Leave a Reply