python create_pretraining_validation_data.py \
    --validation_file /root/autodl-tmp/pretraining_data/validation.txt \
    --tokenizer_path /root/autodl-tmp/pretraining_data/tokenizer \
    --output_file /root/autodl-tmp/pretraining_data/validation.jsonl \
    --max_seq_len 128 \
    --mlm_prob 0.15 \
    --num_samples 1000
