Módulo 5: Desarrollo de Modelos Grandes Sin Conexión

Este capítulo te guía a través de la ejecución de Modelos de Lenguaje Grandes (LLMs) completamente en tu dispositivo Jetson — sin nube, sin claves API, sin que tus datos salgan de tu hardware. Aprenderás los conceptos fundamentales de los LLMs, y luego pondrás en práctica tres marcos de inferencia populares: Ollama, llama.cpp y vLLM. Al final, habrás construido un asistente de voz completamente offline que escucha, piensa y responde.

5-banner

Lo Que Aprenderás

  • Fundamentos de LLM — qué son los modelos, cómo funciona la cuantización y qué significan realmente los "tokens"
  • Ollama — despliegue de modelos con un solo comando para experimentación rápida
  • llama.cpp — inferencia ligera en C/C++ con control detallado sobre la cuantización
  • vLLM — servicio de grado producción con batching continuo y API compatible con OpenAI
  • jetson-examples — desplegar demos de IA pre-construidas con un solo comando
  • Pipeline de voz — combinar ASR + LLM + TTS en un asistente de voz completo sin conexión

Esquema del Curso

Rutas de Aprendizaje Sugeridas

Elige una ruta según tu objetivo:

Inicio Rápido — Pon un modelo en marcha hoy

  1. 5.1 — Introducción a los LLMs — construye el modelo mental
  2. 5.2 — Primeros Pasos con Ollama — primer chat en dos comandos
  3. 5.5 — Inicio Rápido de Jetson Examples — explora demos pre-construidos

Inmersión en Frameworks — Compara motores de inferencia

  1. 5.1 — Introducción a los LLMs
  2. 5.2 — Ollama — configuración fácil
  3. 5.3 — llama.cpp — ligero y personalizable
  4. 5.4 — vLLM — servicio de alto rendimiento

Asistente de Voz — Construye algo que hable

  1. 5.1 — Introducción a los LLMs
  2. 5.2 — Ollama o 5.5 — jetson-examples — pon un modelo en marcha
  3. 5.6 — Pipeline ASR + LLM + TTS — ensambla el bucle de voz completo

Hardware y Prerrequisitos

Hardware Mínimo

ComponenteMínimoRecomendado
DispositivoJetson Orin Nano 8GBJetson Orin NX 16GB Super
Almacenamiento64 GB libres128 GB+ SSD
Swap8 GB16 GB+ para modelos más grandes

Antes de Comenzar

  1. Capítulo 2 — Descripción General de la Plataforma reComputer Jetson
  2. Capítulo 3 — Herramientas Básicas y Primeros Pasos
  3. Docker instalado y configurado (para ejemplos containerizados)
  4. Familiaridad básica con la terminal de Linux

Elegir el Tamaño de Modelo Adecuado

¿No sabes qué modelo se adapta a tu dispositivo? Empieza aquí:

Tamaño del ModeloRAM NecesariaFunciona enVelocidad Típica
1–3B4–6 GBOrin Nano 4 GB+Rápido, interactivo
7–8B8–12 GBOrin Nano 8 GB+Moderado, práctico
13–14B16–24 GBOrin NX 16 GB+Más lento, mayor calidad
35B+48 GB+No recomendado para un solo dispositivoMuy lento

Consejo: Empieza pequeño (3B) para aprender el flujo de trabajo, luego escala cuando te sientas cómodo.

Términos Clave

TérminoQué Significa
LLMModelo de Lenguaje Grande — una red neuronal entrenada con datos de texto masivos para entender y generar lenguaje
InferenciaEjecutar un modelo entrenado para producir salidas a partir de nuevas entradas
CuantizaciónComprimir los pesos del modelo (ej. 16-bit → 4-bit) para usar menos memoria
Ventana de ContextoEl número máximo de tokens que un modelo puede considerar a la vez
TokenUn fragmento de texto (palabra, subpalabra o carácter) que el modelo procesa
GGUFUn formato de archivo para almacenar modelos cuantizados, optimizado para llama.cpp
ASRReconocimiento Automático de Voz — voz a texto
TTSTexto a Voz — texto a audio hablado

Referencias

  • jetson-examples — Demos de IA pre-construidos para Jetson
  • Ollama — Ejecutor de LLM local
  • llama.cpp — Motor de inferencia C/C++
  • vLLM — Servicio de LLM de alto rendimiento

¿Listo para empezar? Salta a Módulo 5.1: Introducción a los Modelos de Lenguaje Grandes para entender los fundamentos, o ve directamente a Módulo 5.2: Primeros Pasos con Ollama si quieres ejecutar tu primer modelo de inmediato.