同传系统真正的难点不是翻得准不准,是什么时候敢输出。等得越久上下文越完整,延迟就越高;提前输出就必须允许回改,而回改在字幕场景里体验很差。BabelBit 是给每个片段一个稳定度阈值,过了阈值才落定,比固定窗口合理,但阈值往上调一点延迟马上就回来了。取舍并没有消失,只是换了个位置。
试了 TEUTONIC 的公开聊天版本,推理延迟比想象中稳定,长上下文没有明显掉链子。中文表现一般,英文和代码更好,估计训练语料偏英文。作为去中心化训练出来的模型,这个完成度已经可以了,期待后面的 checkpoint。