
先从一个很常见的场景说起。你打开 AI 视频生成工具输入“一个女孩在黄昏的海边奔跑”生成出来的画面和想象中完全不是一回事构图很平、光线不对、镜头没有运动甚至女孩的脸都变形了。于是你开始拼命加形容词把提示词写到 500 字结果画面反而更乱。问题出在哪不是模型不行而是提示词缺少“导演思维”。这篇文章就围绕 MiniMax H3 的提示词工程展开重点讲解如何把 LLM 当作“导演 Skill”的大脑让它帮你把一句话创意自动拆解成专业的分镜提示词。就算你之前完全没有接触过 AI 视频提示词也能按本文的思路做出“电影感”短片。适合阅读本文的读者有三类一是经常用 AI 视频生成工具但效果不稳定的创作者二是对提示词工程和 LLM Agent 开发感兴趣的开发者三是想把 AI 视频能力接入自己项目、想沉淀一套可复用提示词模板的人。读完本文你将掌握 MiniMax H3 提示词的结构化写法、导演 Skill 的模板设计思路、一个可以运行的一键生成脚本以及一套稳定排错的工程经验。1. 背景与核心概念1.1 MiniMax H3 到底是什么MiniMax H3下文简称 H3是 MiniMax 推出的视频生成能力。它支持“文字直接生成视频”也可以结合图片输入来做图生视频适合短视频创作、广告分镜预演、内容营销等场景。H3 这类模型已经能生成比较复杂的镜头语言但控制力仍然高度依赖提示词。换句话说模型能力是“下限”提示词质量决定“上限”。从使用方式来看H3 主要有两条路线官方网页端或产品端使用适合非技术用户。通过 API 或本地部署接入项目适合开发者批量生成视频。无论走哪条路线提示词都是你与模型沟通的唯一“语言”。提示词没写好后面所有工作都会打折。1.2 为什么提示词决定视频质量很多初学者有一种误解提示词越长越好描述越细越好。实际上视频生成模型的提示词逻辑和图像生成模型不太一样。图像模型对局部细节更敏感视频模型还必须考虑时间维度的连贯性包括镜头运动、角色连续动作、光线变化和场景切换。MiniMax H3 生成视频时提示词里如果一次性塞入太多冲突信息模型很难取舍。例如“女孩向前跑同时回头看镜头镜头慢慢拉远然后快速推近背景从白天变黑夜”这种提示词几乎必然会生成混乱结果。有效的 H3 提示词应该是结构化的像导演的分镜表一样把主体、场景、镜头、光线、风格拆开描述。这也是本文后面反复强调的核心观点提示词工程不是“堆形容词”而是“拆信息”。1.3 LLM 导演 Skill 是什么“Skill”这个词在 LLM 应用里没有严格定义本文把它理解为一套可复用的提示词模板和生成逻辑。你可以把导演 Skill 想象成一个装在 LLM 里的“副导演”。你只给它一句话创意它会用自己的电影知识把这句话拆分成多个分镜并为每个分镜生成完整的 H3 提示词。你再把这些提示词粘贴到 H3 里就能得到一段段风格统一、镜头有设计感的素材。这样做的好处很明显模板稳定不会漏掉关键要素。换不同创意时输出结构保持一致。可以沉淀成团队内部的“提示词资产”。一句话总结MiniMax H3 负责“生成画面”LLM 导演 Skill 负责“构思画面”。2. 环境准备与提示词工程基础2.1 运行环境说明本文的完整实战案例会编写一个 Python 脚本用 LLM 生成 H3 提示词。版本信息根据你的实际情况调整本文以“兼容 OpenAI 接口风格”的通用方式演示重点展示配置思路。推荐环境如下项目建议操作系统Windows 10/11、macOS、Linux 均可Python3.9 及以上Python 依赖openai、requestsLLM 服务任意兼容 OpenAI Chat Completions 接口的服务商MiniMax H3 入口官方产品页面或官方 API按官方说明申请如果你对 Python 不熟也不用担心。脚本本身很简短你只需要把参数改一改就能跑起来。后续如果使用官方 API记得先确认好鉴权方式、Base URL 和模型名称。2.2 LLM 提示词工程的基础概念在写导演 Skill 之前先梳理几个必须掌握的基础概念。System Prompt给 LLM 设定角色和规则的“总纲”。导演 Skill 的角色设定、输出格式约束都放在这里。User Prompt用户的具体需求。你的一句话创意、风格偏好、时长要求都属于 User Prompt。Temperature控制输出随机性的参数。数值越低输出越稳定、越可控数值越高创造性越强。Few-shot在提示词里给出少量示例引导 LLM 按示例格式输出。这是强遵循度的重要保障。生成 H3 提示词这类任务我更推荐“低温度 结构化 System Prompt Few-shot”的组合。把 LLM 当作执行导演而不是自由编剧。2.3 提示词组织原则根据我连续生成大量 AI 视频的经验下面几条原则非常重要。第一结构大于长度。把提示词按主体、场景、镜头、光线、风格、负面约束分段比写一大段描述要可靠得多。第二少用否定句。比如“不要让画面模糊”容易被模型忽略换成“画面清晰锐利”效果更好。第三一个镜头只表达一个动作。连续动作可以拆成多个分镜不要放在同一个镜头里。第四多用具体名词。与其写“一个漂亮的地方”不如写“布满苔藓的石头墙、雨后积水反射着霓虹灯光”。3. 核心语法、配置与原理拆解3.1 H3 提示词的分块结构虽然不同视频模型的提示词语法有差异但把信息分成清晰的模块几乎是所有模型都能接受的策略。我建议一个 H3 提示词至少包含六个模块模块作用示例主体描述明确画面中的核心人物或物体一个穿着白色连衣裙的年轻女孩场景环境交代背景空间和时间黄昏的海边沙滩远处有一排棕榈树镜头语言定义景别、角度、运镜全景低角度镜头缓慢推进光线氛围控制画面情绪逆光金色阳光柔和暖调风格基调统一视觉风格35mm 胶片质感电影感负面约束说明不希望出现的内容画面模糊肢体扭曲文字水印当提示词按这个结构组织时MiniMax H3 在理解上会轻松很多。很多看起来“模型不行”的问题其实是提示词没有给模型足够的结构化信息。3.2 镜头语言词汇表要做导演 Skill必须有一套镜头语言词汇。下面整理了一份简化版可以用于提示词模板。景别大远景强调环境人物很小适合开场。全景人物完整出现在画面中交代动作。中景人物膝盖以上适合对话和动作。特写人物面部或局部细节适合情感表达。运镜推镜头向前推进逐渐靠近主体。拉镜头向后拉远展示更多环境。摇镜头固定在一点左右旋转。移镜头横向移动。跟拍镜头跟随主体移动。环绕镜头围绕主体旋转。手持轻微晃动增加纪实感。角度低角度镜头低于主体视线显得主体高大。高角度镜头高于主体视线俯视全局。过肩越过人物肩部拍摄适合对话场景。这些词汇加进提示词后画面会立刻摆脱“监控摄像头”式的观感。3.3 强遵循度模式与脑洞模式“强遵循度”和“脑洞模式”是我在工程实践里常挂在嘴边的两个词它们本质上对应 LLM 参数和模板规则的不同配置。强遵循度模式适合你已经明确了创意方向、需要稳定输出的时候。实现思路有三个Temperature 调到 0.2 左右降低随机性。System Prompt 写死输出结构要求必须包含景别、运镜、光线等字段。提供 2 到 3 个 Few-shot 示例让模型照着格式走。脑洞模式适合早期创意探索你想要一些意料之外的东西。实现思路则是Temperature 调到 0.9 左右允许模型发散。模板中“风格”字段留空让模型自己选择。允许在分镜中加入“意外元素”比如一只突然飞过的白鸟。这两个模式不冲突。实际项目里可以先跑一轮脑洞模式找方向确定方向后再用强遵循度模式做批量生成。4. 完整实战案例一句话生成专业 AI 短片4.1 创建项目结构先创建一个干净的目录建议结构如下h3_director/ ├── director.py ├── requirements.txt ├── examples/ │ └── output_example.md └── README.mddirector.py是核心脚本负责调用 LLM 生成 H3 提示词。requirements.txt记录依赖。examples目录保存一次运行后的输出示例。4.2 添加依赖创建requirements.txtopenai1.0.0 requests2.28.0安装依赖pip install -r requirements.txt如果你所在的网络环境访问外部 API 有困难或者你想用本地运行的 LLM可以把 Base URL 指向本地服务后续代码里会体现。4.3 编写一键生成脚本核心脚本director.py如下代码逻辑已经注释清楚。需要注意模型名称和 Base URL 要以你实际使用的服务商为准这里给出的是通用兼容模板。# -*- coding: utf-8 -*- # 文件路径h3_director/director.py import argparse import json from openai import OpenAI SYSTEM_PROMPT 你是资深影视导演和 AI 视频提示词工程师。 你的任务把用户的一句创意扩展为适合 AI 视频生成模型的多个分镜提示词。 输出要求 1. 每个分镜用中文自然段落描述不要携带 Markdown 标题。 2. 每个分镜必须包含景别、镜头运动、画面主体、环境、光线、氛围、风格。 3. 一个镜头只表达一个主要动作不要连续切换多个动作。 4. 使用具体名词和视觉化语言避免“美丽”“好看”等抽象形容词。 5. 只输出 JSON 数组不要输出 JSON 以外的任何解释。 6. 每个元素包含 shot_id、shot_desc、prompt、negative_prompt 四个字段。 参考格式 [ { shot_id: 1, shot_desc: 全景低角度缓慢推进, prompt: 黄昏的海边沙滩穿白色连衣裙的女孩从远处跑向镜头逆光剪影海面泛着金色波纹裙摆随风飘动35mm 胶片质感电影感低角度推进镜头, negative_prompt: 画面模糊肢体扭曲多只手文字水印过度曝光 } ] def build_user_prompt(idea: str, style: str, duration: int, shot_count: int) - str: return f 请根据以下要求生成视频提示词 创意{idea} 风格{style} 目标时长{duration} 秒左右 分镜数量{shot_count} 注意每个分镜的时长可以不均匀由你根据画面信息量分配。 def generate_shots(client, model, idea, style, duration, shot_count, temperature): response client.chat.completions.create( modelmodel, temperaturetemperature, messages[ {role: system, content: SYSTEM_PROMPT}, {role: user, content: build_user_prompt(idea, style, duration, shot_count)}, ], ) content response.choices[0].message.content return json.loads(content) def main(): parser argparse.ArgumentParser(descriptionMiniMax H3 提示词导演 Skill 一键生成器) parser.add_argument(--idea, requiredTrue, help一句话创意例如黄昏海边穿白裙的女孩向镜头跑来) parser.add_argument(--style, default电影感, help画面风格电影感 / 赛博朋克 / 国风 / 动画风格) parser.add_argument(--duration, typeint, default6, help目标视频总时长秒) parser.add_argument(--shots, typeint, default3, help分镜数量) parser.add_argument(--mode, choices[strict, creative], defaultstrict, helpstrict 强遵循度creative 脑洞模式) parser.add_argument(--model, defaultgpt-4o-mini, helpLLM 模型名称按服务商填) parser.add_argument(--base-url, default, helpAPI Base URL按服务商填本地 LLM 也填这里) parser.add_argument(--api-key, default, helpAPI Key按服务商填) args parser.parse_args() client OpenAI( api_keyargs.api_key if args.api_key else None, base_urlargs.base_url if args.base_url else None, ) temperature 0.2 if args.mode strict else 0.9 shots generate_shots( client, args.model, args.idea, args.style, args.duration, args.shots, temperature, ) output json.dumps(shots, ensure_asciiFalse, indent2) print(output) with open(example_output.json, w, encodingutf-8) as fp: fp.write(output) if __name__ __main__: main()这个脚本做了几件关键事情用 System Prompt 固定 LLM 的“导演人设”和 JSON 输出结构。支持--mode参数切换强遵循度和脑洞模式。输出结果同时打印到终端并保存到example_output.json。如果你使用的服务商支持response_format{type: json_object}建议加上这个参数能让 JSON 输出更稳定。4.4 运行与验证命令行执行python director.py \ --idea 黄昏海边穿白裙的女孩向镜头跑来 \ --style 电影感 \ --duration 6 \ --shots 3 \ --mode strict如果一切正常控制台会输出一个 JSON 数组类似下面这样[ { shot_id: 1, shot_desc: 大远景低角度缓慢推进, prompt: 黄昏的海边天空呈橙紫色渐变海面波光粼粼沙滩上穿白色连衣裙的女孩从远处向镜头奔跑逆光剪影海风吹起裙摆和头发镜头缓慢推进35mm 胶片质感电影感低角度机位, negative_prompt: 画面模糊人物扭曲多余肢体文字水印高光溢出 }, { shot_id: 2, shot_desc: 中景侧面跟拍手持镜头, prompt: 黄昏的海边沙滩穿白色连衣裙的女孩侧面奔跑镜头在侧面稳定跟随女孩表情自然微笑金色阳光穿过发丝裙摆飘动海浪在脚下翻涌动态抓拍感电影感调色, negative_prompt: 画面抖动过度肢体僵硬面部变形背景穿帮 }, { shot_id: 3, shot_desc: 特写正面轻微上摇, prompt: 黄昏金色逆光下穿白色连衣裙的女孩面部特写她停下来缓缓看向镜头发丝被海风吹起眼神清澈背景虚化海面和天空形成光斑24mm 电影镜头柔焦浪漫氛围, negative_prompt: 面部畸变眼睛异常肤色失真多余物体 } ]把这 3 段 prompt 依次输入 MiniMax H3 生成片段按照 shot_id 顺序剪辑拼接就能得到一段 6 秒左右、有景别变化、有镜头运动的短片。4.5 从分镜到成品片段的注意事项很多人第一次跑通提示词后会直接拿第一版结果去发布效果其实一般。正确做法是“先生成素材再挑选镜头”。同一个 prompt 可以多生成几次选择画面最稳定的那条。视频生成不像图片生成失败率更高建议同一个分镜至少生成 2 到 3 个候补版本。另外要注意不同版本模型对提示词的敏感性不同。如果你是从其他视频模型迁移过来先跑一个 3 秒小样确认 H3 接受当前提示词风格后再批量制作。5. 常见问题与排查思路5.1 高频问题排查表下面这些问题是使用 MiniMax H3 和 LLM 提示词生成时比较常见的按现象、原因、思路整理。问题现象常见原因解决思路生成画面和提示词明显不符提示词里塞入太多并列信息删减冲突指令一个分镜只保留一个核心动作角色前后不一致缺少固定外貌锚点每个分镜里都带上统一的外貌描述或使用参考图镜头乱切、画面跳变一个镜头里写了多个运镜动作同一分镜只指定一种运镜方式人物肢体扭曲动作描述太复杂模型难以推断改为慢动作或简单动作减少多关节运动API 请求失败或超时输入过长、限流、鉴权配置错误缩短提示词检查配额、API Key 和 Base URL本地部署时显存不足模型体积较大或并发任务过多参考官方部署要求优先使用量化版本降低并发数ComfyUI 与 LLM 无法配合不理解部署架构远程 API 不需要同机本地模型需保证显存和网络连通性5.2 画面不跟随提示词的排查步骤如果你发现 H3 完全“不听话”先不要怀疑模型。按下面的顺序排查第一步检查提示词是否出现两个相反指令。比如“快速奔跑”和“静静站立”同时出现模型必然困惑。第二步检查一个分镜是否包含多段动作。一个分镜只拍一个动作这是硬性规则。第三步检查是否有大量抽象词。把“非常有感觉的氛围”改成“雾气弥漫的湖边清晨冷蓝色调”模型马上就能明白。第四步降低负面约束数量。负面提示词不宜超过 5 个太多负面词容易让模型在画面里“过度补偿”。5.3 ComfyUI 与 LLM 的部署关系“ComfyUI 与 LLM 是否必须在同一台电脑上”是很多人纠结的问题。这里给出一个通用答案如果你把 LLM 作为远程 API 调用那么 LLM 可以放在任何机器上ComfyUI 不需要和它同机。如果你在本地跑开源 LLM同时本地又跑 ComfyUI 和 H3 本地模型就需要考虑显存分配问题建议分开部署或者使用量化模型。具体参数以你使用的模型发布说明为准不要盲目相信某一个“推荐配置”。6. 最佳实践与工程建议6.1 提示词模板也要版本管理导演 Skill 的 System Prompt、镜头词汇表、负面词库都会随着使用经验迭代。我建议把模板文本放到 Git 仓库里管理每次改动注明原因。例如v0.1基础模板包含六个模块。v0.2增加负面约束模块减少水印出现。v0.3补充低角度运镜和光效词库。版本记录能帮你复现“当时生成效果最好的那版模板”这是非常实用的工程习惯。6.2 把提示词组件化把高频出现的描述词做成“词库”或“字典”需要时直接组合。一个简单的示例结构如下{ styles: { cinema: 35mm 胶片质感电影感浅景深, cyberpunk: 赛博朋克霓虹灯光潮湿的夜晚街道高对比度, chinese_style: 中国传统美学水墨淡彩留白构图 }, lens: { track_in: 镜头缓慢推进, track_out: 镜头缓慢拉远, handheld: 手持跟拍轻微晃动 }, light: { golden_hour: 黄昏金色逆光柔和暖调, blue_hour: 蓝色时刻冷色调城市灯光亮起 } }组合时从每个分类里挑一项就能快速生成风格统一的提示词。6.3 稳定优先还是创意优先在实际项目中你要先明确目的。做产品宣传片、品牌广告时稳定大于创意。这时候用强遵循度模式严格套模板避免太多模型“自由发挥”。做灵感探索、创意预演时可以用脑洞模式温度调高允许模型加入意外元素。但脑洞模式的输出要人工筛选不适合直接批量生产。6.4 安全与合规边界使用 H3 和 LLM 生成提示词时必须遵守平台的内容规范和相关法律法规。不要生成违法违规、侵犯他人隐私、涉及暴力或敏感题材的内容。不要试图绕过内容审核机制。使用人物形象、品牌标识、音乐素材时要确保有合法授权。作为技术博主我也要提醒大家提示词工程的意义是让创作更高效而不是挑战安全边界。6.5 成本与效率控制批量生成视频之前先用少量提示词测试模型风格确认可接受后再铺开。LLM 生成提示词的阶段成本很低但如果把大量低质量提示词直接投入 H3 生成视频时间和费用都会浪费。建议执行这样的流程用导演 Skill 生成 5 组候选提示词。人工快速阅读剔除明显不合理项。每个分镜生成 2 个候补视频。挑选最佳镜头进入剪辑。6.6 建立自己的验收清单每次拿到生成的视频按以下维度打分主体是否清晰是否符合描述。镜头运动是否流畅有没有突然跳变。角色或物体的连贯性是否稳定。光线和氛围是否符合预期。是否出现文字水印、肢体扭曲等低级错误。有了评分清单你就能持续优化提示词模板。7. 总结与学习路线本文从一个创作痛点出发梳理了 MiniMax H3 提示词的结构化写法讲清楚强遵循度模式与脑洞模式的实现思路并给出了一个可以直接运行的 LLM 导演 Skill 脚本。你以后再做AI短片时可以考虑这样闭环输入一句话创意用脚本批量生成分镜提示词然后到 H3 中逐段生成素材最后在剪辑软件里拼接成一分钟内的短片。下一步可以继续学习的方向有三个一是在 ComfyUI 工作流中接入 LLM 节点把提示词生成和视频生成串成自动化流水线。二是研究更复杂的 Agent 编排让多个模型各司其职例如一个模型负责分镜另一个模型负责文字镜头感优化。三是积累一套自己的镜头词汇库和风格词库慢慢形成团队级的 AIGC 提示词资产。如果你在 H3 提示词生成过程中遇到过有趣的失败案例也欢迎在评论区分享。多跑几次实验多对比几组输出自然就能找到最适合自己项目的提示词风格。先动手试试吧。