
Databricks Certified Associate Developer for Apache Spark
The Databricks Certified Associate Developer for Apache Spark certification validates your ability to apply the Spark DataFrame API to complete basic data manipulation tasks within a Spark session. It is designed for data practitioners who work with Python and want to demonstrate a solid understanding of Spark architecture, components, and common troubleshooting techniques. Earning this credential signals that you can handle real-world Spark development tasks with confidence.
573 practice questions · Updated 2026-07-30
ASSOCIATE-DEVELOPER-APACHE-SPARK Curriculum
Every domain, objective, and concept the ASSOCIATE-DEVELOPER-APACHE-SPARK exam measures.
- Advantages of Spark
- Challenges of Spark
- Cluster
- Driver Node
- Worker Nodes
- Executors
- CPU Cores
- Memory
- Spark Architecture Overview
- DataFrame and Dataset Concepts
- SparkSession Lifecycle
- Caching and Persistence
- Storage Levels
- Garbage Collection in Spark
- Execution Hierarchy Overview
- Jobs
- Stages
- Tasks
- Dependencies and Shuffles
- Action-Triggered Execution
- Scheduling and Execution Flow
- Partitioning Fundamentals
- Partition Configuration
- Shuffle Operations
- Shuffle Partition Tuning
- Partitioning Strategies
- Partition Skew Handling
- Partitioning for Joins
- Data Locality and Partitioning
- Actions vs. Transformations
- Lazy Evaluation
- Lineage and DAG
- Execution Triggered by Actions
- Evaluation Order and Optimization
- Apache Spark Core
- Spark SQL
- DataFrames
- Pandas API on Spark
- Structured Streaming
- MLlib
- Reading from JDBC sources
- Writing to JDBC sources
- Reading from file sources
- Writing to file sources
- Overwriting data
- Partitioning by column
- Efficient data reading and writing
- SQL on Files Overview
- Querying ORC Files
- Querying JSON Files
- Querying CSV Files
- Querying Text Files
- Querying Delta Files
- Save Modes in Spark SQL
- Persistent Tables
- Saving DataFrames as Tables
- Managed vs External Tables
- Partitioning Tables
- Sorting Data in Tables
- Bucketing Tables
- Optimizing Data Retrieval
- DataFrame to Temporary View Registration
- Temporary View Scope and Lifetime
- Querying Temporary Views with SQL
- Overwriting and Replacing Temporary Views
- Temporary vs Global Temporary Views
- Adding and Dropping Columns
- Renaming Columns
- Filtering Rows
- Splitting Columns
- Exploding Arrays
- Deduplicating DataFrames
- Validating DataFrames
- Unix Epoch to Date String
- Extracting Date Components
- Sorting DataFrames
- Iterating Over DataFrames
- Printing Schema
- Converting DataFrame to Sequence/List
- Converting Sequence/List to DataFrame
- count
- approx_count_distinct
- mean
- summary
- inner_join
- left_join
- broadcast_join
- multiple_keys_join
- cross_join
- union
- union_all
- Reading DataFrames with Schemas
- Writing DataFrames to Storage
- Overwriting DataFrames
- User-Defined Functions (UDFs)
- UDF Performance and Null Handling
- Stateful Operations with mapGroupsWithState
- Stateful Operations with flatMapGroupsWithState
- StateStore and State Management
- State Timeouts and Cleanup
- Partitioning in Spark
- Repartitioning
- Coalescing
- Identifying Data Skew
- Mitigating Data Skew
- Reducing Shuffling
- Optimizing Cluster Utilization
- Define Adaptive Query Execution
- Identify AQE benefits
- Describe AQE features
- Explain dynamic partition pruning
- Explain dynamic join strategy selection
- Explain dynamic skew join optimization
- Enable and configure AQE
- Monitor AQE behavior
- Spark logging architecture
- Configuring Spark logging
- Publishing logs to external systems
- Customizing log formats
- Analyzing driver logs
- Analyzing executor logs
- Diagnosing out-of-memory errors
- Diagnosing cluster underutilization
- Using Spark UI for log correlation
- Monitoring application progress
- Structured Streaming overview
- Programming model
- Micro-batch processing
- Exactly-once semantics
- Fault tolerance mechanisms
- Streaming DataFrame and Dataset creation
- Output modes
- Output sinks
- Writing streaming queries
- Selecting columns from Streaming DataFrames
- Projecting and transforming streaming data
- Filtering streaming data
- Defining event-time windows
- Performing aggregations on streaming data
- Grouping streaming data with windows
- Handling late data and watermarks
- Deduplication without watermark
- Deduplication with watermark
- Watermark configuration
- State cleanup and memory management
- Event-time vs processing-time
- Impact of late data
- Spark Connect Overview
- Architecture of Spark Connect
- Benefits of Spark Connect
- Spark Connect API and Usage
- Deployment mode types
- Client mode
- Cluster mode
- Local mode
- Comparing deployment modes
- Advantages of Pandas API on Spark
- Pandas UDF definition
- Pandas UDF invocation
- Pandas UDF function types
- Pandas UDF performance considerations
Percentages reflect share of the current practice bank, not official exam weightings — no structured per-skill weight is published for ASSOCIATE-DEVELOPER-APACHE-SPARK, so none is invented.