Aprenda a avaliar LLMs de forma prática e profissional, utilizando métricas avançadas e benchmarks personalizados. Domine técnicas para medir desempenho, segurança e eficiência de modelos, garantindo decisões baseadas em dados para deploy em produção.
Nível: Intermediário
Para quem é: Engenheiros de machine learning, cientistas de dados, desenvolvedores de IA e profissionais que trabalham com deploy de LLMs em produção
Ao concluir, você será capaz de: Capacitar o aluno a avaliar, comparar e otimizar LLMs utilizando frameworks de métricas, benchmarks e técnicas de validação automatizada
8 módulos · 12h · certificado ao final
- Entendendo métricas clássicas e modernas para LLMs
- Configurando benchmarks com datasets públicos e privados
- Avaliar respostas de LLMs com métricas de qualidade e segurança
- Automatizando pipelines de avaliação com Python e Hugging Face
- Comparando modelos open-source e proprietários em produção
- Analisando trade-offs: desempenho vs. custo vs. latência
- Criando dashboards de avaliação com Streamlit e Plotly
- Projeto Final: Avaliação completa de um LLM para um caso de uso real
Projeto Final
Um relatório técnico detalhado com métricas, benchmarks e recomendações para otimização de um LLM em um cenário de produção, acompanhado de um dashboard interativo para visualização dos resultados
