def train_with_rfhl():
    """完整的RFHL训练流程"""
    
    # 1. 收集偏好数据
    collector = PreferenceDataCollector()
    # ... 收集数据 ...
    
    # 2. 训练奖励模型
    reward_model = RewardModel()
    # ... 训练奖励模型 ...
    
    # 3. PPO优化
    trainer = PPOTrainer(model, reward_model, tokenizer)
    # ... PPO训练 ...
    
    # 4. 评测
    evaluator = RFHLEvaluator()
    results = evaluator.evaluate_alignment(model, test_data)
    
    return results
