Módulo 5: Desarrollo de Modelos Grandes Sin Conexión
Este capítulo te guía a través de la ejecución de Modelos de Lenguaje Grandes (LLMs) completamente en tu dispositivo Jetson — sin nube, sin claves API, sin que tus datos salgan de tu hardware. Aprenderás los conceptos fundamentales de los LLMs, y luego pondrás en práctica tres marcos de inferencia populares: Ollama, llama.cpp y vLLM. Al final, habrás construido un asistente de voz completamente offline que escucha, piensa y responde.

Lo Que Aprenderás
- Fundamentos de LLM — qué son los modelos, cómo funciona la cuantización y qué significan realmente los "tokens"
- Ollama — despliegue de modelos con un solo comando para experimentación rápida
- llama.cpp — inferencia ligera en C/C++ con control detallado sobre la cuantización
- vLLM — servicio de grado producción con batching continuo y API compatible con OpenAI
- jetson-examples — desplegar demos de IA pre-construidas con un solo comando
- Pipeline de voz — combinar ASR + LLM + TTS en un asistente de voz completo sin conexión
Esquema del Curso
| Módulo | Tema | Dificultad |
|---|---|---|
| 5.1 | Introducción a los Modelos de Lenguaje Grandes | Principiante |
| 5.2 | Primeros Pasos con Ollama | Principiante |
| 5.3 | Ejecutando LLMs con llama.cpp | Intermedio |
| 5.4 | Inferencia de Alto Rendimiento con vLLM | Avanzado |
| 5.5 | Inicio Rápido de Jetson Examples | Principiante |
| 5.6 | Construyendo Pipeline ASR + LLM + TTS | Intermedio |
Rutas de Aprendizaje Sugeridas
Elige una ruta según tu objetivo:
Inicio Rápido — Pon un modelo en marcha hoy
- 5.1 — Introducción a los LLMs — construye el modelo mental
- 5.2 — Primeros Pasos con Ollama — primer chat en dos comandos
- 5.5 — Inicio Rápido de Jetson Examples — explora demos pre-construidos
Inmersión en Frameworks — Compara motores de inferencia
- 5.1 — Introducción a los LLMs
- 5.2 — Ollama — configuración fácil
- 5.3 — llama.cpp — ligero y personalizable
- 5.4 — vLLM — servicio de alto rendimiento
Asistente de Voz — Construye algo que hable
- 5.1 — Introducción a los LLMs
- 5.2 — Ollama o 5.5 — jetson-examples — pon un modelo en marcha
- 5.6 — Pipeline ASR + LLM + TTS — ensambla el bucle de voz completo
Hardware y Prerrequisitos
Hardware Mínimo
| Componente | Mínimo | Recomendado |
|---|---|---|
| Dispositivo | Jetson Orin Nano 8GB | Jetson Orin NX 16GB Super |
| Almacenamiento | 64 GB libres | 128 GB+ SSD |
| Swap | 8 GB | 16 GB+ para modelos más grandes |
Antes de Comenzar
- Capítulo 2 — Descripción General de la Plataforma reComputer Jetson
- Capítulo 3 — Herramientas Básicas y Primeros Pasos
- Docker instalado y configurado (para ejemplos containerizados)
- Familiaridad básica con la terminal de Linux
Elegir el Tamaño de Modelo Adecuado
¿No sabes qué modelo se adapta a tu dispositivo? Empieza aquí:
| Tamaño del Modelo | RAM Necesaria | Funciona en | Velocidad Típica |
|---|---|---|---|
| 1–3B | 4–6 GB | Orin Nano 4 GB+ | Rápido, interactivo |
| 7–8B | 8–12 GB | Orin Nano 8 GB+ | Moderado, práctico |
| 13–14B | 16–24 GB | Orin NX 16 GB+ | Más lento, mayor calidad |
| 35B+ | 48 GB+ | No recomendado para un solo dispositivo | Muy lento |
Consejo: Empieza pequeño (3B) para aprender el flujo de trabajo, luego escala cuando te sientas cómodo.
Términos Clave
| Término | Qué Significa |
|---|---|
| LLM | Modelo de Lenguaje Grande — una red neuronal entrenada con datos de texto masivos para entender y generar lenguaje |
| Inferencia | Ejecutar un modelo entrenado para producir salidas a partir de nuevas entradas |
| Cuantización | Comprimir los pesos del modelo (ej. 16-bit → 4-bit) para usar menos memoria |
| Ventana de Contexto | El número máximo de tokens que un modelo puede considerar a la vez |
| Token | Un fragmento de texto (palabra, subpalabra o carácter) que el modelo procesa |
| GGUF | Un formato de archivo para almacenar modelos cuantizados, optimizado para llama.cpp |
| ASR | Reconocimiento Automático de Voz — voz a texto |
| TTS | Texto a Voz — texto a audio hablado |
Referencias
- jetson-examples — Demos de IA pre-construidos para Jetson
- Ollama — Ejecutor de LLM local
- llama.cpp — Motor de inferencia C/C++
- vLLM — Servicio de LLM de alto rendimiento
¿Listo para empezar? Salta a Módulo 5.1: Introducción a los Modelos de Lenguaje Grandes para entender los fundamentos, o ve directamente a Módulo 5.2: Primeros Pasos con Ollama si quieres ejecutar tu primer modelo de inmediato.