python build_pretraining_samples.py \
  --corpus pretraining_data/train.txt \
  --tokenizer pretraining_data/tokenizer/tokenizer.json \
  --output_dir pretraining_data/dataset \
  --max_seq_len 384 \
  --mlm_prob 0.15 \
  --task nsp \
  --max_samples 200000
