Skip to main content
Deploy DeerFlow to production with enterprise-grade security, reliability, and performance.

Architecture Overview

Pre-deployment Checklist

Infrastructure

  • Kubernetes cluster (EKS, GKE, AKS, or self-hosted)
  • Container registry (ECR, GCR, Docker Hub)
  • Load balancer (ALB, GCE LB, Nginx Ingress)
  • TLS certificates (Let’s Encrypt, AWS ACM)
  • Shared storage (NFS, EFS, Cloud Filestore)
  • Database for checkpoints (PostgreSQL, Redis)
  • Monitoring stack (Prometheus, Grafana)
  • Logging aggregation (ELK, CloudWatch, Loki)
  • Backup solution (Velero, cloud snapshots)

Security

  • API keys stored in secrets manager (Vault, AWS Secrets Manager)
  • Network policies configured
  • RBAC policies defined
  • Security scanning enabled (Snyk, Trivy)
  • SSL/TLS certificates deployed
  • Rate limiting configured
  • DDoS protection enabled
  • Audit logging enabled

Configuration

  • config.yaml prepared for production
  • Environment-specific settings configured
  • Resource limits defined
  • Auto-scaling policies configured
  • Health check endpoints tested
  • Backup retention policies defined

Production Configuration

config.yaml

Production-ready configuration:

Environment Variables

Store sensitive data in secrets:

Container Images

Build Production Images

Frontend Production Dockerfile

Create frontend/Dockerfile.prod:

Backend Production Dockerfile

Create backend/Dockerfile.prod:

Build and Push

Kubernetes Deployment

Namespace

Frontend Deployment

Gateway Deployment

LangGraph Deployment

Services

Ingress

Scaling

Horizontal Pod Autoscaler

Cluster Autoscaler

Enable cluster autoscaler for node scaling:

Monitoring

Prometheus ServiceMonitor

Grafana Dashboard

Key metrics to monitor:
  • Request rate: Requests per second
  • Response time: P50, P95, P99 latencies
  • Error rate: 4xx/5xx responses
  • Active threads: Number of agent threads
  • Sandbox usage: Active sandbox pods
  • Resource utilization: CPU, memory, disk
  • Queue depth: Pending agent tasks

Alerts

Security

Network Policies

Pod Security Policy

Secrets Management

Use external secrets operator:

Backup and Disaster Recovery

Velero Backup

Thread Data Backup

Restore Procedure

Performance Optimization

Caching

  1. Redis for session state:
  2. CDN for static assets:
    • Cloudflare
    • AWS CloudFront
    • Fastly
  3. Response caching:

Database Optimization

For checkpoint storage:

Cost Optimization

Resource Right-sizing

Monitor and adjust resource requests/limits:

Spot Instances

Use spot instances for sandbox pods:

Storage Tiering

Troubleshooting

Check Pod Status

Check Resource Usage

Debug Network Issues

Performance Profiling

Next Steps

Docker Deployment

Learn about Docker-based deployment

Kubernetes Deployment

Deploy on Kubernetes with provisioner

See Also