Aprenda a combinar modelos grandes e rápidos para criar sistemas RAG de alta performance e baixo custo. Domine técnicas de fallback, otimização de embeddings e monitoramento em produção para entregar soluções escaláveis e resilientes.
Nível: Intermediário a Avançado
Para quem é: Engenheiros de machine learning, desenvolvedores de IA, arquitetos de sistemas e profissionais de LLMOps que buscam otimizar pipelines de RAG
Ao concluir, você será capaz de: Capacitar o aluno a projetar, implementar e otimizar sistemas RAG híbridos que combinam modelos grandes (precisão) e rápidos (latência) em ambientes de produção
8 módulos · 12h · certificado ao final
- Entendendo os trade-offs: Precisão vs. Latência em RAG
- Selecionando modelos grandes e rápidos para cenários específicos
- Configurando pipelines híbridos com LangChain e LlamaIndex
- Implementando fallback inteligente entre modelos
- Otimizando embeddings para performance em sistemas híbridos
- Monitorando métricas de custo, latência e qualidade em produção
- Escalando RAG híbrido com LLMOps e orquestração
- Projeto Final: Deploy de um sistema RAG híbrido com monitoramento em tempo real
Projeto Final
Um sistema RAG híbrido funcional com dois modelos (grande e rápido), fallback automático, monitoramento de métricas e deploy em ambiente cloud (AWS/GCP)
