多模态大模型正在从「能生成」走向「生成得像」。本次更新最大的变化是原生音视频同步生成:画面口型、背景音效与情绪节奏由同一套时序建模统一控制,不再需要后期对齐。对内容创作者而言,这意味着一条可直接使用成片的生产时间被大幅压缩。