Building Efficient LLM Applications
Transform your prototypes into fast, reliable production systems by mastering RAG, evaluation pipelines, and practical cost and latency optimization techniques. * **Production-ready RAG pipelines** and reliable agent tooling * **Cost and latency optimization** via caching and quantization * **Automated evaluation frameworks** for tracking output quality * **Scalable serving setups** to deploy robust research prototypes
4 sections ยท 12 lessons
Course outline
Serving Architecture
- Inference Engines
- Continuous Batching
- Model Quantization
- Serving Architecture
Latency Optimization
- Semantic Caching
- Token Streaming
- Speculative Decoding
Evaluation Pipelines
- Automated Benchmarking
- Judge Models
- Cost Accounting
Production Infrastructure
- Model Routing
- Failover Systems
- Telemetry Tracing