Examers.io
ExamsOrganizationsHow it worksPricingHelp & FAQ
DATABRICKS

Databricks Certified Associate Developer for Apache Spark

ASSOCIATE-DEVELOPER-APACHE-SPARKApache Spark Developer Associate

The Databricks Certified Associate Developer for Apache Spark certification validates your ability to apply the Spark DataFrame API to complete basic data manipulation tasks within a Spark session. It is designed for data practitioners who work with Python and want to demonstrate a solid understanding of Spark architecture, components, and common troubleshooting techniques. Earning this credential signals that you can handle real-world Spark development tasks with confidence.

573 practice questions · Updated 2026-07-30

7Domains
27Objectives
168Concepts
573Questions

ASSOCIATE-DEVELOPER-APACHE-SPARK Curriculum

Every domain, objective, and concept the ASSOCIATE-DEVELOPER-APACHE-SPARK exam measures.

  1. Advantages of Spark
  2. Challenges of Spark
  1. Spark Architecture Overview
  2. DataFrame and Dataset Concepts
  3. SparkSession Lifecycle
  4. Caching and Persistence
  5. Storage Levels
  6. Garbage Collection in Spark
  1. Execution Hierarchy Overview
  2. Jobs
  3. Stages
  4. Tasks
  5. Dependencies and Shuffles
  6. Action-Triggered Execution
  7. Scheduling and Execution Flow
  1. Partitioning Fundamentals
  2. Partition Configuration
  3. Shuffle Operations
  4. Shuffle Partition Tuning
  5. Partitioning Strategies
  6. Partition Skew Handling
  7. Partitioning for Joins
  8. Data Locality and Partitioning
  1. Actions vs. Transformations
  2. Lazy Evaluation
  3. Lineage and DAG
  4. Execution Triggered by Actions
  5. Evaluation Order and Optimization
  1. Apache Spark Core
  2. Spark SQL
  3. DataFrames
  4. Pandas API on Spark
  5. Structured Streaming
  6. MLlib

  1. Reading from JDBC sources
  2. Writing to JDBC sources
  3. Reading from file sources
  4. Writing to file sources
  5. Overwriting data
  6. Partitioning by column
  7. Efficient data reading and writing
  1. SQL on Files Overview
  2. Querying ORC Files
  3. Querying JSON Files
  4. Querying CSV Files
  5. Querying Text Files
  6. Querying Delta Files
  7. Save Modes in Spark SQL
  1. Persistent Tables
  2. Saving DataFrames as Tables
  3. Managed vs External Tables
  4. Partitioning Tables
  5. Sorting Data in Tables
  6. Bucketing Tables
  7. Optimizing Data Retrieval
  1. DataFrame to Temporary View Registration
  2. Temporary View Scope and Lifetime
  3. Querying Temporary Views with SQL
  4. Overwriting and Replacing Temporary Views
  5. Temporary vs Global Temporary Views

DataFrame Transformations

14 concepts · 27 questions
  1. Adding and Dropping Columns
  2. Renaming Columns
  3. Filtering Rows
  4. Splitting Columns
  5. Exploding Arrays
  6. Deduplicating DataFrames
  7. Validating DataFrames
  8. Unix Epoch to Date String
  9. Extracting Date Components
  10. Sorting DataFrames
  11. Iterating Over DataFrames
  12. Printing Schema
  13. Converting DataFrame to Sequence/List
  14. Converting Sequence/List to DataFrame

Data Aggregation and Joins

11 concepts · 26 questions
  1. count
  2. approx_count_distinct
  3. mean
  4. summary
  5. inner_join
  6. left_join
  7. broadcast_join
  8. multiple_keys_join
  9. cross_join
  10. union
  11. union_all

Input/Output Operations

3 concepts · 9 questions
  1. Reading DataFrames with Schemas
  2. Writing DataFrames to Storage
  3. Overwriting DataFrames
  1. User-Defined Functions (UDFs)
  2. UDF Performance and Null Handling
  3. Stateful Operations with mapGroupsWithState
  4. Stateful Operations with flatMapGroupsWithState
  5. StateStore and State Management
  6. State Timeouts and Cleanup

Shared Variables and Broadcast Joins

7 concepts · 21 questions
  1. Types of shared variables
  2. Broadcast variables purpose
  3. Broadcast variables implementation
  4. Accumulators purpose
  5. Accumulators implementation
  6. Broadcast joins purpose
  7. Broadcast joins implementation

  1. Partitioning in Spark
  2. Repartitioning
  3. Coalescing
  4. Identifying Data Skew
  5. Mitigating Data Skew
  6. Reducing Shuffling
  7. Optimizing Cluster Utilization
  1. Define Adaptive Query Execution
  2. Identify AQE benefits
  3. Describe AQE features
  4. Explain dynamic partition pruning
  5. Explain dynamic join strategy selection
  6. Explain dynamic skew join optimization
  7. Enable and configure AQE
  8. Monitor AQE behavior
  1. Spark logging architecture
  2. Configuring Spark logging
  3. Publishing logs to external systems
  4. Customizing log formats
  5. Analyzing driver logs
  6. Analyzing executor logs
  7. Diagnosing out-of-memory errors
  8. Diagnosing cluster underutilization
  9. Using Spark UI for log correlation
  10. Monitoring application progress

  1. Structured Streaming overview
  2. Programming model
  3. Micro-batch processing
  4. Exactly-once semantics
  5. Fault tolerance mechanisms
  1. Streaming DataFrame and Dataset creation
  2. Output modes
  3. Output sinks
  4. Writing streaming queries
  1. Selecting columns from Streaming DataFrames
  2. Projecting and transforming streaming data
  3. Filtering streaming data
  4. Defining event-time windows
  5. Performing aggregations on streaming data
  6. Grouping streaming data with windows
  7. Handling late data and watermarks
  1. Deduplication without watermark
  2. Deduplication with watermark
  3. Watermark configuration
  4. State cleanup and memory management
  5. Event-time vs processing-time
  6. Impact of late data

Describe the features of Spark Connect.

4 concepts · 19 questions
  1. Spark Connect Overview
  2. Architecture of Spark Connect
  3. Benefits of Spark Connect
  4. Spark Connect API and Usage
  1. Deployment mode types
  2. Client mode
  3. Cluster mode
  4. Local mode
  5. Comparing deployment modes

  1. Advantages of Pandas API on Spark

Create and invoke Pandas UDF.

4 concepts · 12 questions
  1. Pandas UDF definition
  2. Pandas UDF invocation
  3. Pandas UDF function types
  4. Pandas UDF performance considerations
Ready to practice?Test your knowledge with exam-style questions or take an intelligent quiz tailored to your level.

Percentages reflect share of the current practice bank, not official exam weightings — no structured per-skill weight is published for ASSOCIATE-DEVELOPER-APACHE-SPARK, so none is invented.