Objetivo de aprendizaje: Adaptar LLMs a un dominio: prompt engineering avanzado, fine-tuning eficiente (LoRA/QLoRA) y alineamiento por preferencias (RLHF/DPO).
Prompt engineering avanzado: patrones, few-shot, chain-of-thought, structured output y evals de prompts
Fine-tuning eficiente: LoRA/QLoRA, PEFT y datos de instrucción
Alineamiento por preferencias: RLHF, DPO y reward models
Serving y evaluación del modelo afinado; guardrails y costo
Temario semana a semana
W1Prompt engineering avanzado: patrones, few-shot, chain-of-thought, structured output y evals de prompts
W2Fine-tuning eficiente: LoRA/QLoRA, PEFT y datos de instrucción
W3Alineamiento por preferencias: RLHF, DPO y reward models
W4Serving y evaluación del modelo afinado; guardrails y costo