Skip to content
YYouTube·

Así funciona un LLM por dentro: la explicación más simple

Time & source

Times shown in UTC

Display time zone: UTC

Local time zone unavailable; showing UTC.

PublishedOffset at this time: UTC+0Sep 30, 2026, 01:51 UTC

IngestedOffset at this time: UTC+0Sep 30, 2026, 11:00 UTC

Published
Sep 30, 2026, 01:51
Ingested
Sep 30, 2026, 11:00
Source type
Unclassified
Source status
Healthy

Un LLM, el tipo de modelo que hay detrás de ChatGPT, Claude o Gemini, escribe apostando por la siguiente pieza de texto, una y otra vez. En este video abrimos GPT-2, la versión pequeña que OpenAI publicó en 2019, y seguimos una sola frase por todo el mecanismo con números medidos: cómo se corta en tokens y cada token se vuelve una lista de números (embedding); cómo la atención usa el contexto para saber que «bank» es una orilla y no un banco; cómo se reparten las probabilidades de la siguiente palabra, qué cambia la temperatura y por qué el modelo escribe un token por vuelta; de dónde salen sus 124 millones de parámetros; y por qué a veces inventa con total seguridad u olvida el principio de un chat largo.

Al final vas a poder explicar por qué a «Fishing on the river bank, I caught a…» GPT-2 le dio casi 78 % a «glimpse» y poco más de medio por ciento a «fish».

La explicación usa una sala donde cada token se sienta a una mesa, lleva una credencial y mira hacia atrás a los demás; después de cada paso vuelve al modelo real. Las probabilidades, los tokens, las continuaciones y las salidas que ves en pantalla salen de ejecutar el modelo público gpt2 (124 439 808 parámetros) con NumPy y el tokenizador tiktoken «gpt2». Otros modelos dan cifras distintas.

Para sentar en la mesa la información correcta (tus documentos y tus datos): Cómo usar bien la IA: prompt, contexto, RAG y MCP sin código: https://www.youtube.com/watch?v=FrnFJDpPfrw

00:00 Qué hace un LLM con tu frase 01:14 Tokens: cómo se corta el texto 02:21 Embeddings: el texto se vuelve números 03:31 Atención: cómo usa el contexto 04:48 Capas y la prueba del autobús 05:47 Probabilidades: la siguiente palabra 06:59 Temperatura 07:55 Un token por vuelta 08:45 Entrenamiento y parámetros 10:23 Alucinaciones 11:32 Ventana de contexto 12:15 El recorrido completo

Fuentes: Vaswani et al., «Attention Is All You Need» (2017): https://arxiv.org/abs/1706.03762 Radford et al., «Language Models are Unsupervised Multitask Learners» (GPT-2, OpenAI, 2019): https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf Brown et al., «Language Models are Few-Shot Learners» (GPT-3, 2020): https://arxiv.org/abs/2005.14165 Sennrich, Haddow y Birch, subpalabras con BPE (2015): https://arxiv.org/abs/1508.07909 Holtzman et al., «The Curious Case of Neural Text Degeneration» (2020): https://arxiv.org/abs/1904.09751 Ouyang et al., InstructGPT (2022): https://arxiv.org/abs/2203.02155 Anthropic: ventanas de contexto: https://platform.claude.com/docs/en/build-with-claude/context-windows Google Books Ngram: «caught a glimpse» frente a «caught a fish» (2000–2019): https://books.google.com/ngrams/graph?content=caught+a+glimpse%2Ccaught+a+fish&year_start=2000&year_end=2019&corpus=en-2019&smoothing=0

#LLM #InteligenciaArtificial #ChatGPT #Programación #Torticode

Source·YouTube·youtube.com