扣子搭视频生产智能体:跑通1小时排坑一下午

一句话结论:智能体之前也搭建过,整体不算太难,但是搭视频智能体这块还没完整的试过,我选了个能出成品的方向——输入一个成语,自动产出一条带画面、配音、字幕的视频。用扣子(Coze)搭大脑一小时就跑通了,但真正让它"能用",又用 Codex 调试了一下午。看到抖音上面很多有意思的视频,也想倒腾下,做视频这块,我是新手,不排除是我哪里配置错了,把过程原样记下来,懂行的朋友欢迎指正。
智能体这个词今年太火了。
但看来看去,网上大部分"智能体"就是个聊天框:接个大模型,套层提示词,能问答就叫智能体了。我一直想搭个能干活、出成品的——不是跟我聊天,是给它一个题目,它把活干完,把结果交到我手上。
视频这块,第一次上手,选了个小场景:成语故事视频生产智能体。输入"龟兔赛跑",它自动写文案、出画面、配语音、加字幕,最后交给我一个剪映草稿,打开就能导出成片。
这个智能体的全貌
| 组成 | 干什么 | 用什么 |
|---|---|---|
| 大脑:工作流 | 理解题目、策划内容、生产素材、组装草稿 | 扣子 + 豆包 2.0 pro + Seedream + seedance |
| 手脚:工具链 | 把云端草稿落地到本地剪映 | 剪映小助手插件(米核)+ Codex 技能 |
| 产出 | 50 多秒成品视频草稿 | 剪映专业版 |
工作流只是其中一个环节——虽然是最核心的那个。大脑想清楚了,手脚跟不上,智能体照样瘫痪。后面会讲到,我这一下午就卡在"手脚"上。
最终效果
输入一个成语主题,智能体自动产出一条 50 多秒的成品草稿:6 段画面、6 段配音、6 条字幕,打开剪映就是排好版的时间线,字幕、配音、画面严丝合缝。
视频版每段画面是 seedance 生成的 10 秒动态视频,下面是同一段视频第 1、5、9 秒的抽帧,松鼠的姿势和场景都在动:

静态抽帧只能看出场景在变,视频有点大,不好上传,这里就不完整展示视频了

智能体的大脑:工作流三段流水线

作为第一次搭视频智能体的人,我按照网上的流程一步一步构建出这些完整的流程。后来静下来捋了一遍,其实就三段:

第一段,内容策划。 四个大模型节点串行:1 号写文案(故事正文),2 号固化形象(把兔子、乌龟的外形描述固定下来,后面每张图都带这段描述,角色才不会变脸),3 号把文案切成 6 个分镜,04 节点把每个分镜翻译成绘画提示词。
第二段,素材生产。 三个批处理并行跑:图像生成(Seedream 4.0,每分镜一张图)、视频生成(doubao-seedance-pro,每分镜一段视频)、语音合成(speech_synthesis,每分镜一段配音 mp3)。
第三段,组装草稿。 五个数据格式化节点(audio_timelines、video_infos、caption_infos、imgs_infos、audio_infos)把素材整理成插件要的格式,然后 create_draft 建空草稿,add_videos、add_captions、add_images、add_audios 依次把四条轨道写进去,结束节点输出草稿 ID。
整条流水线的时间轴基准是配音时长:每段配音多长,对应的画面和字幕就排多长。想通这一点之后,整个工作流突然就不难懂了——文案每段写多长,直接决定了视频节奏。
智能体的最后一公里:四个现象和 Codex 排查实录
大脑跑通,输出草稿 ID,我以为结束了。结果从"云端草稿"到"本地剪映能用的草稿"这最后一公里,走了一下午。
先声明:我不确定这些是插件的 bug 还是我自己的配置问题,只是把现象、排查过程和最后的解决办法记下来。有对米核客户端、剪映小助手比较熟悉的朋友,欢迎指导。
现象一:米核 App 下载不了自己的草稿
剪映小助手 App 点下载,转圈几秒后报"下载失败链接"。一开始以为要充值。后来用 Codex 查了网络请求,发现草稿数据本身是公开接口,https://miheai.com/plugin/draft/草稿ID 直接返回完整 JSON,素材链接用 curl 跟随跳转就能下。可能是 App 下载器对某类签名链接的处理有问题,也可能是我账号哪里没弄对——总之绕过 App 直接拉数据,问题就解决了。
现象二:字幕轨有内容,画面里看不到
草稿打开,字幕轨明明有内容,播放器里就是没有字。
Codex 对比了我的草稿和正常草稿,发现轨道数组的顺序不一样:我这个把字幕夹在了视频轨中间。剪映的规则是数组靠后、层级靠上,字幕被上面的视频轨盖住了。把字幕轨挪到所有视频轨之后,字就露出来了。
现象三:字幕变成白框,字是透明的
层级调好后,选中字幕,画面里只有一个白色线框,字没了。
这一步查得最久。Codex 把正常草稿的字幕素材和我的逐字段对比,发现我的字幕素材里塞了 60 多个字段,正常草稿只有 12 个;而且填充色缺了透明度字段,背景色为空但背景不透明度是 1。把这些素材按正常草稿的精简结构重建,只保留文字、颜色、字号、位置,白框消失,字也出来了。
现象四:改了字幕颜色不生效
工作流里把字幕颜色从红色改成米黄色(f9f3c4),重跑,装进去一看,还是旧的棕色。
Codex 对比发现:素材顶层 text_color 是新颜色没错,但正文样式里写的还是旧颜色,两处数据不一致,而剪映渲染认的是正文样式。以顶层颜色为准覆盖过去,就对了。
这四个问题修完后,我让 Codex 把整个"拉草稿、下素材、修结构、装进剪映"的过程封装成了一个技能。现在链路变成:扣子跑完出 ID,技能一条命令装好。到这一步,这个智能体才算真正能干活了。
说实话,没有 Codex 这种能直接读草稿文件、逐字段对比的工具,光靠肉眼在剪映界面上点,我可能到现在还在猜。
add_captions 参数(我的最终配置)
字幕样式全在这个节点的参数里,这是我调到最后能正常显示的组合:

| 参数 | 我的填法 | 说明 |
|---|---|---|
| alpha | 1 | 不透明度,别空着 |
| text_color | f9f3c4 | 填充色,以这个顶层参数为准 |
| border_color | 和文字同色或对比色 | 默认 dad1cf 是浅灰白,容易出"白框"观感;同色相当于加粗 |
| font_size | 6 | 2560 宽画布上 6 号够看 |
| transform_x | 0 | 水平居中 |
| transform_y | -1000 | 重点,见下 |
transform_y 这个参数我来回试了好多次才对。实际测下来的规律是:剪映里显示的位置大约只有填值的一半。画布高 1440,想让字幕在画面中心往下 500 像素,得填 -1000。不知道是我理解错了单位,还是插件和剪映的换算本来就不一致——反正按 2 倍填,位置就是准的。
视频生成节点的三个体会
- 时长:节点可选 5 秒或 10 秒。配音段长度是文案决定的,我这个工作流每段配音 5.4 到 14.9 秒不等,5 秒的视频盖不住长段。选 10 秒,同时把文案每段尽量控制在 10 秒内。
- 分辨率:节点选的是 1080P,实际出片只有 864×480,放到 2K 画布上会糊。不知道是不是我套餐或模型限制,有懂的朋友可以说说。
- 提示词:默认只接分镜描述,生成的视频动作幅度很小,"动了跟没动一样"。想要动感,提示词里得加动作和运镜,比如"兔子快速奔跑,镜头侧面跟随"。
验证智能体是否真的能干活(我的检查清单)
- 工作流跑完,结束节点输出草稿 ID;
- 浏览器打开
https://miheai.com/plugin/draft/草稿ID,能看到完整 JSON,说明云端草稿正常; - 装进剪映后查三件事:视频轨在字幕轨下面、字幕颜色字号和工作流设置一致、总时长等于各段配音之和;
- 按空格播放,画面动、字幕跟着配音走,收工。
🎯 老张心得
第一次搭视频智能体,最大的体会是:智能体不是搭个聊天框接个大模型就完事——工作流只是它的大脑,大脑到产出之间还隔着一整条工具链。
网上大部分教程教的是"大脑怎么思考",没人教"手脚怎么落地"。而真实世界里,卡住你的恰恰是那些没人讲的环节。
还有一条:结构化数据出问题,别在界面上瞎点,把文件打开逐字段对比,比什么都快。这次全靠 Codex 干这个活。
最后再说一遍:上面四个现象,到底是插件的问题还是我配置的问题,我没完全搞清楚。有对米核客户端、剪映小助手比较熟悉的朋友,欢迎指导,评论区等你。
💬 互动话题
你搭的第一个智能体是干什么的?跑通之后,卡在了哪个"最后一公里"?
你觉得"能聊天"和"能干活"的智能体,差别到底在哪?
🔗 关注老张
公众号:老张聊运维 小程序:观简国学 个人博客:https://www.shanwaiyun.top/