用户说话 → 实时识别 → 流式翻译 → 实时合成 → 流式输出
   ↓         ↓         ↓         ↓         ↓
 开始说中文   边听边识别   边翻译边优化   边合成边播放   流式听到英文
 总延迟：200-500毫秒
