你将学到什么
- 五要素提示结构(主体、动作、场景、风格、镜头),每次都能复用
- 如何把含糊的提示改写为精确版本——含前后对比示例
- 为何加入否定提示(“无文字、无水印”)能净化结果
- 一次只改一处的迭代闭环,让画面更好且无需猜测
模型如何解读你的提示
文生视频模型并不像人那样“理解”故事——它会将你的文字与已学到的视觉进行模式匹配。越具体描述画面应出现什么以及镜头如何运动,它就越少需要猜测。明确的名词、单一清晰的动作、指名的镜头运动,比一堆情绪形容词更有效。
一套行之有效的提示结构
像导演那样描写镜头——主体、动作、场景、风格与镜头。控制在一到两句清晰的话内。
- 1主体:画面中的是谁/什么(“一位咖啡师”,“一部流线型手机”)。
- 2动作:发生了什么(“倒出拉花”,“在底座上缓慢旋转”)。
- 3场景:地点与环境(“日照充足的精品咖啡馆”,“极简棚拍,柔和阴影”)。
- 4风格:画面质感(“电影感、浅景深、暖色调”)。
- 5镜头:运动方式(“慢速推进”,“环绕”,“静态大全景”)。
改写前后对比
含糊: “一段咖啡视频”。更好: “特写:咖啡师在木质吧台上向白杯中倒出拉花,日照充足的精品咖啡馆,电影感,浅景深,慢速推进,无文字。”第二条提示控制了主体、场景、光线、镜头与运动——模型需要臆造的更少,你更常得到可用的镜头。
说清你不想要的
否定提示能让结果更干净。加入“无文字、无水印、无标志、无多余手指”以避免典型AI伪影。为确保品牌安全,可加“通用包装、无品牌Logo”。一小段排除清单往往比再添一个形容词更能提升质量。
迭代优化,别一次写太满
先用聚焦的提示生成,再一次只改一处——先调光线,再调镜头运动,再调情绪。一次堆十个形容词会让你无法判断究竟是什么起了作用。把每次生成都当作只含一个变量的实验。
打造可复用的“频道基调”
当你找到喜欢的观感后,把提示中与风格相关的半部分保存为后缀(如“电影感,4K,自然柔光,浅景深”),并在不同片段间复用。每个镜头只改主体与动作,但频道基调会让整套视频在视觉上一致——这正是让频道看起来更专业的关键。
速览要点
- 把最重要的视觉信息放在最前——模型会更重视提示的开头。
- 指名镜头运动(“慢摇”、“环绕”、“静态”)以控制节奏与能量感。
- 复用“频道基调”后缀,让所有片段保持一致观感。
- 一镜头只做一件事——把“走进来并坐下并说话”拆成独立场景。
- 保留一个优秀提示词的“灵感库”,把产出好镜头的提示词收集起来,复用并重混。
常见问题
提示词多长合适?
一到两句清晰的话通常胜过一大段。要具体,不要冗长。
我能在不同模型间使用同一条提示词吗?
可以——在 Vivideo 上,你可以用同一条提示词跑不同模型(Sora、Veo、Kling 等),并进行对比。
为什么我的视频会忽略提示词的一部分?
模型更重视开头,后面的细节可能被丢弃。把关键元素前移,或拆到另一段场景里。
提示词在图生视频里也有效吗?
有效——在有输入图片时,提示词主要引导演动与机位,而非主体本身。
如何在不同镜头间保持角色一致?
复用同一份详尽的主体描述,或使用头像/参考图,让外观保持稳定。










