Step Catalog

Every pipeline step that cursus supports — 61 steps — generated directly from the .step.yaml interface files. Each row links to that step’s page: its purpose, its inputs (with the upstream steps that can produce them), its outputs, and the downstream steps that consume it.

A cursus pipeline is a DAG of these steps. An edge is valid when a downstream step’s input type matches an upstream step’s output, and the upstream step is listed among the input’s compatible producers — see The DAG + Config → Pipeline model and Registry and Step Catalog.

The Compute column names how a step’s container is built: an SDK-managed DLC (sklearn / xgboost / framework / estimator / model), the SAIS script image, or byo_container — a user-supplied ECR image run verbatim (no image_uris.retrieve), which is how a non-DLC framework (e.g. GraphStorm/DGL) enters cursus. A step may also declare a per-step VPC (network_mode: config) to reach a VPC-only data source — shown on its page’s Compute section.

CradleDataLoading

Cradle data loading — pull source data via the SAIS/Cradle SDK.

Step

Node

Compute

Purpose

Consumes

Produces

CradleDataLoading

source

Cradle data loading step.

processing_output

RedshiftDataLoading

Redshift data loading — load data from Redshift via the SAIS SDK.

Step

Node

Compute

Purpose

Consumes

Produces

RedshiftDataLoading

source

Redshift SQL data loading step (source node with optional EDX upload).

processing_output

Processing

Processing jobs — data prep, feature engineering, evaluation, packaging.

Step

Node

Compute

Purpose

Consumes

Produces

ActiveSampleSelection

internal

sklearn

Active sample selection step that intelligently selects high-value samples from model predictions for Semi-Supervised Learning (SSL) or Active Learning workflows using confidence-based, uncertainty-based, diversity-based, or hybrid strategies.

processing_output

processing_output

BedrockBatchProcessing

internal

framework

Bedrock batch processing step that provides AWS Bedrock batch inference capabilities with automatic fallback to real-time processing for cost-efficient large dataset processing.

processing_output

processing_output

BedrockProcessing

internal

framework

Bedrock processing step that processes input data through AWS Bedrock models using generated prompt templates and validation schemas.

processing_output

processing_output

BedrockPromptTemplateGeneration

internal

sklearn

Bedrock prompt template generation step that assembles the prompt-config bundle (system prompt, category rules, output schema) into ONE standardized prompts.json prompt ruleset ({ruleset, rules} shape) with the output schema embedded in the prompt — the same contract the knowledge-routing producer emits, consumed by the Bedrock processing steps.

processing_output

processing_output

CurrencyConversion

internal

sklearn

Currency conversion processing step.

processing_output

processing_output

DataUploading

sink

Upload processed data to BDT (EDX/Andes) via SAIS SDK delegation.

processing_output

DummyDataLoading

internal

sklearn

Dummy data loading step that processes user-provided data instead of calling Cradle services.

processing_output

processing_output

DummyTraining

internal

framework

Training step that uses a pretrained model.

hyperparameters, model_artifacts

model_artifacts

EdxUploading

sink

script

Upload S3 data to EDX via EdxDataLoader (SINK node, no Kale required).

processing_output

FeatureSelection

internal

sklearn

Feature selection step using multiple statistical and ML-based methods with ensemble combination strategies.

processing_output

processing_output

GraphConstruction

internal

byo_container

GraphStorm gconstruct — build a partitioned DGL heterograph from the node/edge parquets + gconstruct schema emitted by GraphFeatureProcessing.

processing_output

processing_output

GraphFeatureProcessing

internal

byo_container

Turn per-seed subgraph pickles + labelled seeds into the GraphStorm GConstruct input (per-type node/edge parquets, reverse edges, node-ID-keyed masks, gconstruct_config.json).

processing_output

processing_output

GraphStormGNNInferenceEval

internal

byo_container

GraphStorm/DGL GNN out-of-time inference + evaluation on a custom GraphStorm GPU container (online-inference simulator → ROC-AUC / PR-AUC / Recall@Precision report + plots).

model_artifacts, processing_output

processing_output

GraphSubgraphExtraction

source

byo_container

Point-in-time k-hop subgraph pull from a property-graph DB for seed order IDs (BYO GraphStorm image, VPC-bound).

processing_output

processing_output

LabelRulesetExecution

internal

sklearn

Label ruleset execution step that applies validated rulesets to processed data to generate classification labels using priority-based rule evaluation with execution-time field validation.

processing_output

processing_output

LabelRulesetGeneration

internal

sklearn

Label ruleset generation step that validates and optimizes user-defined classification rules for transparent, maintainable rule-based label mapping in ML training pipelines.

processing_output

processing_output

LightGBMMTModelEval

internal

framework

LightGBM multi-task model evaluation step.

model_artifacts, processing_output

processing_output

LightGBMMTModelInference

internal

framework

LightGBM multi-task model inference step for prediction generation without metrics.

model_artifacts, processing_output

processing_output

LightGBMModelEval

internal

framework

LightGBM model evaluation step.

model_artifacts, processing_output

processing_output

LightGBMModelInference

internal

framework

LightGBM model inference step for prediction generation without metrics.

model_artifacts, processing_output

processing_output

MissingValueImputation

internal

sklearn

Missing value imputation step using statistical methods (mean, median, mode, constant) with pandas-safe values.

processing_output

processing_output

ModelCalibration

internal

sklearn

Calibrates model prediction scores to accurate probabilities.

processing_output

processing_output

ModelMetricsComputation

internal

sklearn

Model metrics computation step for comprehensive performance evaluation.

processing_output

processing_output

ModelWikiGenerator

internal

sklearn

Model wiki generator step for automated documentation creation.

processing_output

processing_output

Package

internal

sklearn

Model packaging step.

custom_property, model_artifacts, processing_output

model_artifacts

Payload

internal

sklearn

Payload testing step.

model_artifacts, processing_output

processing_output

PercentileModelCalibration

internal

framework

Creates percentile mapping from model scores using ROC curve analysis for consistent risk interpretation.

processing_output

processing_output

PiperMetricGeneration

internal

sklearn

PIPER metric generation step; recomputes ROC/PR curves and emits PIPER .metric + paired data CSVs flat to the output root for PIPER rendering.

processing_output

processing_output

PseudoLabelMerge

internal

sklearn

Pseudo label merge step that intelligently combines labeled base data with pseudo-labeled or augmented samples for Semi-Supervised Learning (SSL) and Active Learning workflows with split-aware merge, auto-inferred split ratios, and provenance tracking.

processing_output

processing_output

PyTorchModelEval

internal

framework

PyTorch model evaluation step.

model_artifacts, processing_output

processing_output

PyTorchModelInference

internal

framework

PyTorch model inference step for prediction generation without metrics.

model_artifacts, processing_output

processing_output

RiskTableMapping

internal

framework

Risk table mapping step for categorical features.

hyperparameters, processing_output

processing_output

SlipboxKnowledgeRouting

internal

framework

Slipbox knowledge routing step that hosts the DKS knowledge+ruleset corpus and runs compile→index→route internally, emitting a compiled prompt ruleset plus per-record routed rule names and routing confidence for downstream Bedrock processing.

custom_property, model_artifacts, processing_output

processing_output

StratifiedSampling

internal

sklearn

Stratified sampling step with multiple allocation strategies for class imbalance, causal analysis, and variance optimization.

processing_output

processing_output

TSAModelCalibration

internal

sklearn

TSA (Temporal Self-Attention) model calibration step using monotone B-spline calibration for converting raw prediction scores to well-calibrated probabilities for fraud detection.

processing_output

processing_output

TSAModelEval

internal

framework

TSA (Temporal Self-Attention) model evaluation step for dual-task PyTorch models with comprehensive metrics and visualizations.

model_artifacts, processing_output

processing_output

TSAPreprocessing

internal

framework

TSA (Temporal Self-Attention) data preprocessing step that performs sequence processing with feature transformation and scaling for fraud detection models.

processing_output

processing_output

TSATabularPreprocessing

internal

framework

TSA (Temporal Self-Attention) tabular preprocessing with explicit output declarations for processed_data and preprocessor artifacts.

processing_output

processing_output

TabularPreprocessing

internal

sklearn

Tabular data preprocessing step.

processing_output

processing_output

TemporalFeatureEngineering

internal

sklearn

Temporal feature engineering step that extracts comprehensive temporal features from normalized sequences for machine learning models.

processing_output

processing_output

TemporalSequenceNormalization

internal

sklearn

Temporal sequence normalization step for machine learning models with configurable sequence operations.

processing_output

processing_output

TemporalSplitPreprocessing

internal

sklearn

Temporal split preprocessing step with customer-level splitting and OOT validation.

processing_output

processing_output, training_data

TokenizerTraining

internal

framework

BPE tokenizer training step for customer name data with automatic vocabulary size tuning.

processing_output

processing_output

XGBoostModelEval

internal

xgboost

XGBoost model evaluation step.

model_artifacts, processing_output

processing_output

XGBoostModelInference

internal

xgboost

XGBoost model inference step for prediction generation without metrics.

model_artifacts, processing_output

processing_output

XgboostMtModelEval

internal

framework

XGBoost multi-task model evaluation step.

model_artifacts, processing_output

processing_output

Training

Training jobs — fit a model from prepared data + hyperparameters.

Step

Node

Compute

Purpose

Consumes

Produces

GraphStormGNNTraining

internal

byo_container

GraphStorm/DGL R-GCN GNN training on a partitioned heterograph, run in a bring-your-own GraphStorm ECR container.

hyperparameters, processing_output

model_artifacts, processing_output

LightGBMMTTraining

internal

estimator

LightGBM multi-task training with adaptive weighting and knowledge distillation.

hyperparameters, processing_output, training_data

model_artifacts, processing_output

LightGBMTraining

internal

estimator

LightGBM model training step using built-in algorithm.

hyperparameters, processing_output, training_data

model_artifacts, processing_output

PyTorchTraining

internal

estimator

PyTorch model training step.

hyperparameters, processing_output, training_data

model_artifacts, processing_output

SOPAInstructionTuning

internal

estimator

SOPA Stage 2 instruction fine-tuning step for BLIP2-based model (Q-Former + Phi-3 LLM) with tabular-to-text instruction following.

model_artifacts, training_data

model_artifacts, processing_output

TSATraining

internal

estimator

TSA (Temporal Self-Attention) model training step for PyTorch-based temporal attention models.

hyperparameters, training_data

model_artifacts, processing_output

XGBoostTraining

internal

estimator

XGBoost model training step.

hyperparameters, processing_output, training_data

model_artifacts, processing_output

XgboostMtTraining

internal

estimator

XGBoost multi-task training with one_output_per_tree strategy.

hyperparameters, processing_output, training_data

model_artifacts, processing_output

Transform

Batch transform jobs — run inference over a dataset with a model.

Step

Node

Compute

Purpose

Consumes

Produces

BatchTransform

internal

transformer

Batch transform step.

custom_property, processing_output

custom_property

CreateModel

Model creation — wrap trained artifacts into a deployable SageMaker model.

Step

Node

Compute

Purpose

Consumes

Produces

PyTorchModel

internal

model

PyTorch model creation step.

model_artifacts

custom_property

XGBoostModel

internal

model

XGBoost model creation step.

model_artifacts

custom_property

MimsModelRegistrationProcessing

Model registration — register a model with MIMS.

Step

Node

Compute

Purpose

Consumes

Produces

Registration

sink

Model registration step.

model_artifacts, payload_samples

Tuning

Hyperparameter tuning jobs — search a training step’s hyperparameters for the best model.

Step

Node

Compute

Purpose

Consumes

Produces

GraphStormGNNTuning

internal

byo_container

GraphStorm/DGL R-GCN hyperparameter tuning — a HyperparameterTuner search over the GNN training estimator, run in a bring-your-own GraphStorm ECR container.

hyperparameters, processing_output

model_artifacts


This catalog is generated from src/cursus/steps/interfaces/*.step.yaml by docs/gen_step_catalog.py. To change a step’s catalog entry, edit its .step.yaml and re-run the generator.