python train_wordpiece_tokenizer.py \
  --input pretraining_data/train.txt \
  --output_dir pretraining_data/tokenizer \
  --vocab_size 30000 \
  --sample_size 5000 \
  --lowercase
