Get in Touch

Course Outline

Core Principles of Cloud Operations on AWS

  • Defining operational roles and responsibilities within the cloud landscape
  • Structuring AWS accounts, organizations, and implementing multi-account strategies
  • Key operational services: CloudWatch, CloudTrail, and AWS Config

Infrastructure as Code and Automated Provisioning

  • Foundational principles of IaC and the benefits of immutable infrastructure
  • Executing provisioning tasks using Terraform and AWS CloudFormation
  • Managing state files, modules, and promoting environments effectively

CI/CD Pipelines and Deployment Methodologies

  • Architecting CI/CD pipelines for cloud-native applications
  • Implementing blue/green, canary, and rolling deployment strategies
  • Automating rollbacks, health checks, and release validation processes

Monitoring, Observability, and Alerting Mechanisms

  • Handling metrics, logs, and traces: collection, storage, and analysis
  • Utilizing CloudWatch, X-Ray, and third-party observability platforms
  • Establishing SLOs/SLIs, defining alerting policies, and managing on-call rotations

Security Operations and Identity Governance

  • Applying IAM best practices, enforcing least privilege, and managing cross-account access
  • Managing secrets, KMS, and securing parameter stores
  • Operational security measures: patching strategies, vulnerability scanning, and maintaining audit trails

Resilience, Backup, and Disaster Recovery Strategies

  • Designing systems for fault tolerance and high availability
  • Developing backup strategies, automating snapshots, and defining restore procedures
  • Formulating disaster recovery plans and creating comprehensive runbooks

Cost Optimization and Governance Frameworks

  • Gaining cost visibility through billing analysis, tagging, and cost allocation strategies
  • Rightsizing resources, utilizing reserved instances/savings plans, and controlling budgets
  • Ensuring governance through policies, guardrails, and compliance automation

Containers, Serverless Architecture, and Runtime Management

  • Operational considerations for ECS, EKS, and Lambda services
  • Managing service discovery, autoscaling, and resource constraints
  • Logging, tracing, and debugging containerized workloads

Incident Response, Playbooks, and Chaos Engineering

  • Conducting runbook-driven incident response and executing postmortem analyses
  • Automating remediation tasks and implementing self-healing patterns
  • Introduction to chaos engineering experiments for validating system resilience

Practical Workshop: Managing a Sample Workload

  • Deploying a sample application utilizing IaC and a CI/CD pipeline
  • Configuring monitoring, alerts, and automated remediation scripts
  • Simulating incidents and practicing runbook-based response protocols

Conclusion and Future Directions

Requirements

  • Foundational knowledge of cloud computing concepts and networking principles
  • Proficiency with the Linux command line and scripting languages
  • Practical experience with source control systems (Git) and fundamental CI/CD workflows

Target Audience

  • Cloud operations engineers
  • Site Reliability Engineers (SREs) and platform engineers
  • DevOps engineers and technical team leaders
 21 Hours

Number of participants


Price per participant

Testimonials (1)

Upcoming Courses

Related Categories