用 AI 五分钟写完口播稿我拍了 17 遍用 AI 写一条 5 分钟的口播稿现在只要五分钟。上个月我就这么干然后把稿子拍了 17 遍。卡住我的不是内容是我念不出来。在整条视频生产链上AI 已经把写和剪都大幅降本了只有对着镜头把稿子讲出来这一步还是纯人力 —— 而且它是唯一一步废了救不回来的。剪坏了能重剪字幕错了能改但你讲漏的那句话不在素材里就是不在素材里。一条 8 分钟的片子如果平均每条重来 6–8 次真实投入就是 50 分钟以上而且全是站着重新讲一遍。念不出来只有两个原因忘了下一句要说什么→ 停下重讲而且通常得从段落开头接回去记得内容、记不住措辞→ 要么绕成自己的口语语义漂了要么就得看稿看稿→ 眼神离开镜头、语调变平观众不一定说得出哪里怪但会划走这是个死结背稿不现实800 字的稿子背下来比录一遍还慢看稿又不自然。所以解法不是记得更牢而是让稿子出现在你视线的正确位置。这件事的关键从来不是记忆力是眼神。提词的难点不是显示稿子是放在哪传统提词器是给演播室做的镜头前挂一块半透镜稿子从下往上滚主播眼睛看稿、镜头拍到的却是他在看镜头。代价是要硬件、要位置、要有人操作而且只服务出镜这一种场景。搬到手机上多数做法是把稿子贴在屏幕边缘、或者另开一个窗口 —— 眼神偏了那个窗口本身还可能被录进画面。真正的难点在这里提词得浮在画面上但它会不会被拍到取决于你怎么拍。讲笔手机版是按拍法切模式的拍法提词放哪出镜口播全屏提词浮在自己的摄像头画面上用系统相机、抖音等第三方 App 拍悬浮小窗浮在最上层自拍时不入镜手机录屏 / 录像改双设备提词放另一台机器或耳返最后一行是个硬边界录屏抓的是合成之后的显示输出悬浮层就在那一层里系统层面排不掉—— 这不是某个 App 没做好是机制本身如此。官网把这条限制直接写出来了没有把悬浮窗吹成万能这一点我比较认可。真正救重录的是两个小动作念漏了拨回去—— 按住提词区左右滑动把提词拨回你正在念的那句不用停机重来。这一下省掉的往往是一整段录制中随手改—— 字号、滚动速度、美颜、画中画录着就能改不用退出重录稿子在录制前、录制中都能直接编辑把重录从重来一遍降级成拨一下比让你一次就成功更有价值。两个限制也顺便说清楚手机版不做剪辑只做提词和拍摄修片还得回桌面端语音跟随走的是实时识别服务断网时不可用。顺序别搞反如果你正准备做口播或教程视频先解决讲不顺 —— 它决定你要拍几遍是乘数再解决剪得慢 —— 它决定你后期花多久是加数很多人是反过来的肯花一下午研究剪辑软件的分割和关键帧却不肯花十分钟解决我念不出来这件事。前者最多省你十分钟后者能省你一个小时。