TSAPreprocessing¶
TSA (Temporal Self-Attention) data preprocessing step that performs sequence processing with feature transformation and scaling for fraud detection models
SageMaker step type |
|
Node type |
internal (consumes upstream, produces downstream) |
Container entry point |
|
Interface file |
|
Compute¶
Compute kind |
|
SDK class |
|
Functionality¶
TSA preprocessing script that performs CID sequence processing for fraud detection. It loads model artifacts (preprocessor, categorical mappings, default values, Python modules), loads and combines data from tabular preprocessing output, processes Customer ID (CID) sequences, applies feature transformations, scaling, and categorical encoding, handles time windowing and downsampling for different dataset types, and outputs numpy arrays for TSA model training. Inputs are artifacts (model artifacts read from /opt/ml/processing/input/code/artifacts), preprocessor (optional training-fitted scaling parameters, used via PREPROCESSOR_PATH when provided), and processed_data (tabular preprocessing output with train/test/val splits). Output is tsa_processed_data (5 numpy arrays per dataset - CID categorical sequences, CID numerical sequences, static features, labels, amounts). Supports streaming mode (ENABLE_TSA_STREAMING) for memory-efficient processing of large datasets.
Inputs (dependencies)¶
Input |
Type |
Required |
Compatible producers |
|---|---|---|---|
|
|
no |
CradleDataLoading, DummyDataLoading, DataLoad, ProcessingStep, TabularPreprocessing |
|
|
no |
TSATabularPreprocessing, ProcessingStep |
|
|
yes |
TabularPreprocessing, TSATabularPreprocessing, CradleDataLoading, DummyDataLoading, DataLoad, ProcessingStep |
Outputs¶
Output |
Type |
|---|---|
|
|
Consumers (downstream steps)¶
Steps that declare this step as a compatible input source:
Framework requirements¶
Package |
Version |
|---|---|
|
|
|
|