Capstone — El servicio AI, demostrable y defendible
El cierre: el proyecto ancla que construiste módulo a módulo, terminado, desplegado y defendible — la pieza de portafolio que el carril AI-native pide ver funcionando.
Outcome: un servicio backend AI en producción que podés mostrar en vivo y defender decisión por decisión (chunking, modelo, retrieval, evals, costo, seguridad).
Qué tenés que tener construido (checklist)
- A0 — endpoint con structured output validado (pydantic), tokens/costo medidos
- A1 — RAG core: corpus ingestado (chunk+embed→pgvector) + retrieval top-k
- A2 — retrieval mejorado (reranking + hybrid) con métrica de recall antes/después
- A3 — agente LangGraph que usa el RAG como tool, con límite de pasos
- A4 — segunda tool + servidor MCP que expone las tools
- A5 — dataset de eval (10+ casos) con RAGAS + LLM-as-judge que gatea el deploy + observabilidad (Langfuse/OTel: tokens, costo, traces)
- A6 — FastAPI con auth + rate limit + routing de modelos + guardrails (prompt injection) + Docker + deploy en Cloud Run con CI/CD
Lo que lo vuelve defendible (no solo “funciona”)
El diferenciador de este nicho no es que responda — es que puedas mostrar:
- Que no alucina, con números: una eval que mide faithfulness/relevancy y un antes/después cuando cambiaste el chunking o sumaste reranking. “Subí context precision de 0.6 a 0.85 cambiando X.”
- Que corre barato: medición de tokens y latencia por request, y una decisión de routing (modelo chico para lo simple) defendida con datos.
- Que es seguro: guardrails contra prompt injection, validación de output, no filtra el system prompt.
- Que es observable: un trace de una request mostrando dónde se fue el tiempo y el costo (retrieval vs LLM).
- Que se despliega solo: push → CI corre las evals → si pasan, deploya.
Entregable de portafolio
- Repo con handbook (Architecture / Conventions / Decisions / Glosario / Workflow / Errors) + un ADR por decisión grande (por qué ese vector store, ese modelo, ese chunking).
- Demo en vivo (dominio propio) — que el reclutador lo pruebe.
- Write-up “por qué cada decisión” + el antes/después de las evals.
- Narrativa de 2 min: qué problema resuelve, cómo sabés que funciona (evals), cómo lo hacés barato y seguro.
Esto es exactamente lo que los roles AI-native / agentic buscan ver demostrado — más que cualquier certificado o lista de tecnologías.
Cómo defenderlo (mock design review)
Preparate para responder, en voz alta y en inglés:
- ¿Por qué RAG y no fine-tuning? ¿Por qué ese chunk size?
- ¿Cómo sabés que no alucina? Mostrá la eval.
- ¿Qué pasa si el LLM se cae / responde mal / tarda? (retry, fallback, timeout, guardrail)
- ¿Cómo escala y cuánto cuesta a 10x tráfico?
- ¿Cómo evitás prompt injection y fuga de datos entre usuarios?