How do you deploy an ML model to production?
Short Answer
Package model (ONNX, TorchScript, SavedModel) → Create API (FastAPI/Flask) → Containerize (Docker) → Deploy (Kubernetes, AWS SageMaker, or serverless) → Monitor (latency, drift, accuracy).
Key Points
- Model serialization: pickle, joblib, ONNX, TorchScript
- Serving: FastAPI (async), TorchServe, TensorFlow Serving, Triton
- Scaling: Horizontal (multiple replicas) + load balancing
- Monitoring: Data drift, prediction drift, latency P99
💡 Memory Trick: "ML Deployment = Train → Package → Serve → Monitor → Retrain (continuous loop)"