model_input = {
    'noisy_image': x_t,           # 带噪图像
    'timestep': t,                # 时间步
    'time_embedding': time_emb,   # 时间嵌入
    'text_embedding': text_emb,   # 文本嵌入
    'class_embedding': class_emb  # 类别嵌入（可选）
}
