python analyze_length_distribution.py \
  --corpus pretraining_data/train.txt \
  --tokenizer pretraining_data/tokenizer/tokenizer.json \
  --task nsp \
  --sample_size 200000 \
  --targets 0.1,0.2 \
  --candidates 256,384,448,512 \
  --output_dir pretraining_data/analysis
