
CertNexus Certified Data Science Practitioner (CDSP)
The CertNexus Certified Data Science Practitioner (CDSP) certification validates your ability to answer real-world questions by collecting, wrangling, and exploring data sets, then applying statistical models and AI algorithms to extract and communicate actionable insights. Designed for professionals across industries, it proves you can define the right question, perform ETL, build and test predictive models, and deliver findings that drive decisions.
841 practice questions · Updated 2026-02-16
CERTIFIED-DATA-SCIENCE-PRACTITIONER Curriculum
Every domain, objective, and concept the CERTIFIED-DATA-SCIENCE-PRACTITIONER exam measures.
- Project Specifications
- Deliverables Identification
- Timeline Determination
- Limitations Assessment
- Data Science Terminology
- Milestone Definition
- Proof of Concept (POC)
- Minimum Viable Product (MVP)
- Data Privacy Policies
- GDPR Compliance
- HIPAA Compliance
- California Privacy Act
- Data Governance Policies
- Stakeholder Data Access
- Informed Consent Controls
- Problem classification
- Optimization problem
- Forecasting problem
- Regression problem
- Classification problem
- Segmentation/Clustering problem
- Data source identification
- Data type identification
- Structured vs unstructured data
- Image data
- Text data
- Numerical data
- Categorical data
- Modeling type selection
- Recommender systems
- Read Data from Various Sources
- SQL Query Writing
- NoSQL Query Writing
- Cloud Storage Integration
- First-, Second-, and Third-Party Data Sources
- Data Collection Methods
- Data Sharing Agreements
- Exploring Third-Party Data Availability
- Collecting Open-Source Data
- Using APIs for Data Collection
- Web Scraping
- Generating Dummy or Test Data
- Generating Randomized Data
- Generating Anonymized Data
- Generating AI-Generated Synthetic Data
- Identify and eliminate irregularities in data
- Handle nulls
- Remove duplicates
- Correct corrupt values
- Parse data
- Check for corrupted data
- Correct data format
- Deduplicate data
- Apply risk and bias mitigation techniques
- Understand common forms of ML bias
- Identify sources of bias
- Use exploratory data analysis for outlier detection
- Assess data quality
- Use data auditing techniques
- Mitigate bias impact
- Evaluate bias outcomes
- Monitor and improve data cleaning process
- Adhere to data governance rules
- Join data from different sources
- Ensure common key exists in all datasets
- Unique identifiers
- Load data into database
- Load data into dataframe
- Export cleaned dataset
- Load data into visualization tool
- Make an endpoint or API
- Word tokenization
- Word vectorization
- Word2Vec
- TF-IDF
- GloVe
- Latent representations for image data
- Summary statistics
- Feature types
- Univariate distributions
- Multivariate distributions
- Outlier detection
- Correlation analysis
- Target feature identification
- Identify missing values
- Understand types of missing data
- Decide on missing value handling
- Apply imputation methods
- Apply record removal
- Normalize data
- Standardize data
- Scale data
- One-hot encoding
- Target encoding
- Label/Ordinal encoding
- Dummy encoding
- Effect encoding
- Binary encoding
- Base-N encoding
- Hash encoding
- Split features
- Text manipulation - Split
- Text manipulation - Trim
- Text manipulation - Reverse
- Manipulate data - Split names
- Manipulate data - Extract year from title
- Convert dates to useful features
- PCA (Principal Component Analysis)
- Missing value ratio
- t-SNE (t-Distributed Stochastic Neighbor Embedding)
- Low-variance filter
- Random forest feature importance
- High-correlation filter
- Backward feature elimination
- SVD (Singular Value Decomposition)
- Forward feature selection
- False discovery rate
- Factor analysis
- Feature importance methods
- Data Splitting Ratios
- Training, Test, and Validation Set Roles
- Stratified Splitting
- Random vs. Non-Random Splitting
- Data Leakage Prevention
- Temporal Splitting for Time-Series Data
- Reproducibility in Data Splitting
- Define models to try
- Linear regression
- Random forest regression
- XGBoost regression
- Logistic regression
- Random forest classification
- XGBoost classifier
- Naïve Bayes
- ARIMA
- K-means clustering
- Density-based clustering
- Hierarchical clustering
- Train or pre-train or adapt transformers
- Hyperparameter tuning
- Cross-validation
- Grid search
- Gradient descent
- Bayesian optimization
- Define evaluation metric
- Compare model outputs
- Confusion matrix
- Learning curve
- Select best-performing model
- Store model for operational use
- MLflow
- Kubeflow
- A/B testing fundamentals
- Hypothesis formulation
- Sample size determination
- Randomization and control
- Metrics selection
- Statistical significance testing
- Interpreting results
- Avoiding common pitfalls
- Define experimental design
- Identify experimental design types
- Plan experiments
- Control confounding variables
- Randomization and replication
- Analyze experimental results
- Identify use cases for model testing
- Define testing objectives
- Select appropriate testing methods
- Design test cases and scenarios
- Establish success criteria
- Define test creation
- Identify test data requirements
- Design test cases
- Implement test harness
- Execute tests
- Document test results
- Statistical hypothesis testing
- Common statistical tests
- Confidence intervals
- Effect size and practical significance
- Assumptions and diagnostics
- Define success criteria
- Align criteria with business objectives
- Select appropriate metrics
- Set thresholds and benchmarks
- Document success criteria
- Evaluate test results
- Streamlined Pipeline Tools
- Pipeline Automation
- Enterprise Data Strategy
- Data Management Architecture
- Data Warehouse ETL
- Data Lake ETL
- Data Mesh Principles
- Micro-services and APIs
- Data Fabric Concepts
- Data Virtualization
- Low-Code Automation Platforms
- Model deployment strategies
- Production environment considerations
- AWS SageMaker deployment
- Azure ML deployment
- Docker containerization for models
- Kubernetes for model orchestration
- MLflow for model lifecycle management
- Kubeflow for ML workflows
- Operational model validation
- Model performance monitoring metrics
- Data drift detection
- Concept drift detection
- Pipeline monitoring setup
- Alerting and incident response
- Datadog integration for model monitoring
- Confidentiality measures
- Integrity measures
- Access control measures
- POC Web App Implementation
- Web Frameworks (Flask, Django)
- Basic HTML
- CSS
- Deriving Insights from Findings
- Feature Importance Analysis
- Model Results Presentation
- Lift and Gain Charts
- Model Transparency and Explainability
- Intrinsic Explainable Methods
- Post Hoc Explainable Methods
- Visualization for Explanation
- Attention Mechanisms
- Avoiding Black-Box Techniques
- XAI Frameworks and Tools
- SHAP
- LIME
- ELI5
- What-If Tool
- AIX360
- Skater
- Model Lifecycle Documentation
- ML Design and Workflow
- Code Comments
- Data Dictionary
- Model Cards
- Impact Assessments
- Stakeholder Analysis
- User Testing
- Feedback Loops
- Participatory Design
- Data Accessibility
- Plain-Language Communication
- Self-Service Analytics Platforms
- Data Literacy Culture
- Employee Data Education
- Data Support and Guidance
- Data Transparency and Collaboration
Percentages reflect share of the current practice bank, not official exam weightings — no structured per-skill weight is published for CERTIFIED-DATA-SCIENCE-PRACTITIONER, so none is invented.