
AWS Certified Data Engineer - Associate
The AWS Certified Data Engineer - Associate certification validates your ability to implement data pipelines, manage data stores, and ensure data quality on AWS. Designed for data engineers with 2–3 years of experience, it demonstrates hands-on skills in ingesting, transforming, and orchestrating data while applying security and governance best practices. Earning this credential proves you can build and operate reliable, cost-effective data solutions on the world's leading cloud platform.
452 practice questions · Updated 2026-07-30
DEA-C01 Curriculum
Every domain, objective, and concept the DEA-C01 exam measures.
- Streaming Data Sources
- Batch Data Sources
- Batch Ingestion Configuration
- Data API Consumption
- Scheduling with EventBridge
- Scheduling with Apache Airflow
- Time-Based Schedules for Jobs and Crawlers
- Event Triggers with S3 Event Notifications
- Event Triggers with EventBridge
- Lambda Invocation from Kinesis
- IP Allowlists for Data Sources
- Throttling and Rate Limits
- Fan-in and Fan-out in Streaming
- Replayability of Data Ingestion Pipelines
- Stateful and Stateless Data Transactions
- Container optimization for data workloads
- Connecting to data sources via JDBC/ODBC
- Integrating data from multiple sources
- Cost optimization in data processing
- Selecting data transformation services
- Transforming data between formats
- Troubleshooting transformation failures and performance issues
- Creating data APIs with AWS services
- Defining data volume, velocity, and variety
- Integrating LLMs for data processing
- Orchestration service selection
- Building ETL workflows with orchestration services
- Performance optimization in data pipelines
- High availability and scalability in pipelines
- Resiliency and fault tolerance in pipelines
- Serverless workflow implementation
- Notification and alerting with SNS and SQS
- Integrating notifications into pipelines
- Code Optimization for Data Pipelines
- Lambda Concurrency and Performance Configuration
- Programming Languages and Frameworks for Data Engineering
- Software Engineering Best Practices in Data Engineering
- Infrastructure as Code (IaC) Fundamentals
- AWS SAM for Serverless Data Pipelines
- Lambda Storage Volume Mounting
- CI/CD for Data Pipelines
- Distributed Computing Concepts
- Data Structures and Algorithms
- Cost and performance trade-offs of data stores
- Access pattern-driven storage configuration
- Use-case-specific storage application
- Migration tool integration
- Data migration and remote access methods
- Lock management for data access control
- Open table format management
- Vector index types
- Data Catalog Fundamentals
- Technical Data Catalogs
- Building and Referencing Catalogs
- Schema Discovery with Crawlers
- Partition Synchronization
- Creating Catalog Connections
- Business Data Catalogs
- Redshift COPY command
- Redshift UNLOAD command
- S3 Lifecycle policy basics
- S3 Lifecycle expiration
- S3 versioning
- DynamoDB TTL
- Data deletion for compliance
- S3 resiliency and availability
- Redshift schema design
- DynamoDB schema design
- Lake Formation schema design
- Handling data characteristic changes
- Schema conversion with AWS SCT
- Schema conversion with AWS DMS
- Data lineage with SageMaker ML Lineage Tracking
- Data lineage with SageMaker Catalog
- Indexing best practices
- Partitioning strategies
- Compression techniques
- Data optimization techniques
- Vectorization concepts
- Orchestrating data pipelines with Amazon MWAA
- Orchestrating data pipelines with AWS Step Functions
- Troubleshooting Amazon MWAA
- Troubleshooting AWS Step Functions
- Calling AWS SDKs from code
- Processing data with Amazon EMR
- Processing data with Amazon Redshift
- Processing data with AWS Glue
- Consuming data APIs
- Maintaining data APIs
- Preparing data with AWS Glue DataBrew
- Preparing data with Amazon SageMaker Unified Studio
- Querying data with Amazon Athena
- Automating data processing with AWS Lambda
- Managing events with Amazon EventBridge
- Managing schedulers for data jobs
- Data visualization with AWS services
- Data verification and cleaning techniques
- SQL querying in Amazon Redshift
- SQL querying in Amazon Athena
- Athena notebooks with Apache Spark
- Provisioned vs serverless services tradeoffs
- Data aggregation
- Rolling average
- Data grouping
- Data pivoting
- Log extraction for audits
- Deploy logging and monitoring solutions
- Notifications for monitoring alerts
- Troubleshooting performance issues
- AWS CloudTrail for API tracking
- Troubleshooting and maintaining pipelines
- CloudWatch Logs configuration and automation
- Log analysis with AWS services
- Data Quality Checks During Processing
- Defining Data Quality Rules
- Investigating Data Consistency
- Data Sampling Techniques
- Data Skew Mechanisms
- VPC Security Groups
- IAM Groups and Roles
- IAM Endpoints and Services
- AWS Secrets Manager Credentials
- IAM Roles for AWS Services
- IAM Policies for Resources
- Managed vs Unmanaged Services
- SageMaker Unified Studio Access
- Custom IAM policy creation
- IAM policy evaluation and best practices
- AWS Secrets Manager for credential storage
- AWS Systems Manager Parameter Store for credentials
- Database user, group, and role management in Amazon Redshift
- Database authorization and privilege granting
- AWS Lake Formation permissions management
- Encryption at rest
- Encryption in transit
- Key management
- Data masking techniques
- Tokenization
- Anonymization and pseudonymization
- Encryption and masking in AWS services
- Compliance and regulatory considerations
- Audit Logging Fundamentals
- Identifying Audit Log Sources
- Enabling Audit Logging
- Log Aggregation and Centralization
- Log Retention and Lifecycle Management
- Log Integrity and Tamper-Proofing
- Access Control for Audit Logs
- Monitoring and Alerting on Audit Logs
- Audit Log Analysis and Reporting
- Data Privacy Fundamentals
- Data Governance Frameworks
- Data Classification
- Data Masking and Anonymization
- Data Encryption
- Access Control and Authorization
- Data Residency and Sovereignty
- Data Retention and Lifecycle Policies
- Auditing and Monitoring Data Access
- Privacy Impact Assessments
- Data Subject Rights
- Governance for Machine Learning Data
Percentages reflect share of the current practice bank, not official exam weightings — no structured per-skill weight is published for DEA-C01, so none is invented.