English

这两个月全网刷屏的 AI 视频深度动作捕捉,猫斯卡把整条流水线开源了:ReShot,参考片变深度图,Seedance 照着走位打,8 GB 显卡和 Mac 都能跑

猫斯卡编辑部 | 最后更新日期

舞蹈复刻、打戏复刻背后就是这一招;为什么深度图能让模型只学动作不抄脸、我们在技术上做对了哪四件事、什么机器能跑、怎么装怎么用,一篇讲完

猫斯卡(www.maosika.com)今天开源了 ReShot,把这两个月刷屏的「深度动作捕捉」做成了一条完整的流水线,Apache-2.0,随便用,包括商用。

一段参考视频进去,一段深度图视频出来,近白远黑。把它当参考视频交给 Seedance 或 MiniMax H3,模型照着里面的走位和运镜再拍一遍,脸、衣服、画风全换成你的。

咱先验货。

上排:参考片和它的深度图。下排:同一张深度图生成的三段片

上排左边是一场走廊打戏,一个人靠墙蹬墙扯下一根管子,跟几个黑衣守卫打了一圈,被最大的那个从背后抱住、反手把他摔了,最后擦擦嘴走出门。

上排右边是它的深度图。

下排三条片,铠甲女战士、旗袍女、戴拳套的卡通兔子,脸、衣服、画风全不一样,可蹬墙那一下、被抱起那一下、走出门那一下,时间点和镜头位置跟参考片是同一套。

最能说明问题的是兔子那条:参考片里从背后抱她的是守卫里个头最大的那个,兔子那条里抱它的是熊,狼、虎、熊三个对手里最大的那个。

模型没有看到任何一张脸,它是从灰影的体积里读出「谁最大」的。

五条片拼在一格里是方便你对时间点,三条生成片和完整提示词都在 GitHub 仓库里,一字没删。

深度动作捕捉到底是什么,为什么这两个月全网都在用

先说它解决的问题。

Seedance 2.0 从年初开始支持参考视频,你上传一段片,它复刻里面的动作和运镜。

大家很快发现一个麻烦:原片直接喂给它,模型连脸、衣服、灯光、房间一起抄了,出来的东西一眼就是人家那条。

片子里有真人的话,参考素材还过不了审,直接翻车。

然后有人试出了一招,我第一次看到也觉得有点东西:先把原片转成深度图,再把深度图当参考视频喂进去。

深度图是什么?每个像素的亮度代表这个点离镜头有多近,近的白,远的黑。

整段片转完,画面里只剩下一团一团的灰影,没有脸,没有衣服,没有颜色,没有背景纹理,只剩下四样东西:谁站在哪、谁大谁小、怎么动、镜头怎么走。

模型拿到这段灰片,能抄的只有这四样,脸和衣服想抄也没得抄,只能从你的提示词和参考图里拿。

这就是「深度动作捕捉」,舞蹈复刻、打戏复刻、跑酷复刻这两个月刷屏,底下全是这一招。

海外把它叫 depth map trick,ComfyUI 社区有现成的工作流,网上冒出一堆在线转换器和模板。

它的意义比「一个技巧」大。

视频生成模型的可控性一直是最难的一环,文字管不住动作,原片又管得太多。

深度图第一次把「怎么动」和「长什么样」干净地拆成了两路输入,动作走深度图,外观走参考图和提示词,各管一头,互不打架。

图像时代 ControlNet 的深度控制干的就是这件事,现在它在视频上成立了。

问题是,这一招今天要么在收费的在线服务里,要么得自己在 ComfyUI 里连线、找模型、对参数。

我们把整条流水线做完,开源了。

我们做了什么

ReShot 不是一个「跑个深度模型」的脚本,它把从参考片到能直接上传的深度图视频之间的每一步都做了,并且给了三种入口。

网页。 终端敲一个 reshot,浏览器弹出页面,参考片拖进去,选给哪家模型用,点一下,参考片和深度图并排预览,下载,旁边附好给 Seedance 或 MiniMax H3 的提示词开头。

所有计算在你自己电脑上,片子不上传到任何地方。

ReShot 的网页,左边参考片和深度图并排,右边选给哪家模型用
ReShot 的网页,左边参考片和深度图并排,右边选给哪家模型用

命令行。 reshot 参考片.mp4 -o 深度图.mp4 --target seedance,一次丢一个文件夹也行,模型只加载一次,批量跑很丝滑。

ComfyUI。 两个节点,一个吃视频吐视频,一个吃图片序列吐图片序列,放在 Load Video 和你的视频模型之间,深度图在工作流里直接流过去。

三个预设对着三家模型的参考视频规格:seedance 出 24 帧每秒、边长对齐 16 的倍数、不超过 15 秒;h3 对 MiniMax H3;wan 对 Wan 2.1 VACE。

你不用查任何一家的文档。

技术上做对的四件事

深度图人人会抽,抽出来能不能用是另一回事。

ReShot 在四个地方做了取舍,每一条都是我们拿实测数字换来的。

一、用视频深度模型,不用图像深度模型。

大多数在线转换器是把视频拆成图片,一张一张跑图像深度模型,再拼回去。

每一张的黑白刻度都是独立算的,拼回去整段片一闪一闪,人明明站着不动,灰度在跳。

视频模型读这种片,读到的是一个抖动的人。

ReShot 底下是 Video Depth Anything,它是为视频设计的:一次看 32 帧,相邻两段之间重叠 10 帧,靠时间维度的注意力让前后帧的深度互相对齐。

抽出来的片,人站着不动,灰度就不动。

二、整段视频只归一化一次。

模型输出的是相对深度,还要压成 0 到 255 的灰度。

ReShot 是把整段视频当一个整体做归一化:最近的那一点定白,最远的那一点定黑,所有帧共用同一把尺。

人从走廊深处走到镜头前,灰度是连续变亮的,而不是每一帧各自重新拉伸。

三、按时间戳取帧,只裁不补。

参考片可能是 30 帧或 60 帧每秒,Seedance 要 24。

ReShot 按时间戳重采样,不是隔几帧丢一帧,动作的时间点不会漂。

尺寸要对齐 16 的倍数时只裁边,绝不在画面外补黑边,黑边在深度图里会被读成「最远的一圈东西」,把整段的刻度带歪。

四、推理分辨率和输出分辨率脱钩,跑之前先算账。

模型看的是缩小后的画面,输出的深度图仍然和原片一样大。

默认档位显存 3 GB,速度快;显存 12 GB 以上的卡可以切「完整」档,细轮廓更锐。

同一段片实测两档的差别,平均只有 5 个灰阶,95% 的像素差在 15 以内,虽然细轮廓有差,但视频模型要的大形状两档一模一样。

跑之前 ReShot 先按「2 GB 加每像素每帧 20 字节」估一次内存峰值,超过机器一半内存就在开始之前拒绝,不会跑到一半把电脑卡死。

这条公式是我们在 4090 上六个点拟合出来的,误差不到 50 MB。

消费级显卡、Mac、纯 CPU,都能跑

机器能不能跑实测
8 GB 显存的 N 卡(3070、4060 这一档)默认档显存 3 GB
3080 Ti / 4090能,两档都放得下默认档 34 毫秒一帧,12 秒的片十来秒
Apple 芯片 MacM2 Max 上 46 毫秒一帧,12 秒的片 18 秒
没有显卡能,慢接近 2 秒一帧,12 秒的片十来分钟

有人会问缩小后的画面精度够不够。

够的,我们自己给 MiniMax H3 喂的深度图比默认档还小得多,上面三条片就是那么出的,照样能打。

怎么装,怎么用

装。 有 Python 的机器,终端两行:

pip install "reshot[ffmpeg]"
reshot

第二行敲完浏览器自动打开页面。

模型权重 111 MB,第一次运行自动下载,在中国大陆先设一下镜像:

export HF_ENDPOINT=https://hf-mirror.com

不想自己配环境,把这句话粘给 Claude Code 或 Codex,让它替你装:

按 https://raw.githubusercontent.com/maosika-ai/reshot/main/docs/AGENT_INSTALL.md 从 PyPI 安装 reshot,识别我的系统和显卡装对应的 PyTorch,跑一段短片验证一次。

ComfyUI 用户装节点包 ComfyUI-ReShot,仓库里带两个示例工作流,拖进去就能跑,我在 ComfyUI 最新版上验过。

交给 Seedance。 深度图当参考视频上传,提示词开头写一句「参考@视频1的动作与运镜,顺序与视频保持一致」,后面接你的人物、服装、场景、画风。

交给 MiniMax H3。 深度图挂成 <Video 1>,定妆图挂成 <Picture 1>,提示词里用文字把灰片里发生的事复述一遍,再明说一句灰色外观不要抄,不然它可能真给你出一部灰片。。。

上面三条片就是这么出的。

女战士江雪和旗袍女苏晚,定妆图是在猫斯卡(www.maosika.com)上自动生成的,没有人写提示词,没有连节点。

江雪,定妆图
江雪,定妆图
苏晚,定妆图
苏晚,定妆图
兔子拳手,设定图
兔子拳手,设定图

说句实话,旗袍那条我一开始不太信,开衩那么高,蹬墙扯管子这种动作最容易穿模。

它做了,蹬墙那一下腿是抬起来的,衩口跟着裙摆走,落地之后旗袍还是那件旗袍。

挑一根刺的话,摔人那一下三条片里被摔出去的守卫都糊成了一团黑影,黑衣服加快速翻滚,这是视频模型的老毛病,谁家都容易在这掉链子。

但摔人的时机、摔完站的位置、接下来把最后一个撞上墙板的那一下,三条片跟参考片都对得上,旗袍那条撞墙板时还带了一串火花。

代码、文档、演示片、三条片的完整提示词都在 GitHub,仓库名 maosika-ai/reshot,中英文说明各一份。

GitHub 上的 ReShot 仓库
GitHub 上的 ReShot 仓库

为什么开源

猫斯卡(www.maosika.com)自己就是干这个的:从一句话想法开始,自动写剧本、出定妆图、出场景图、生成每一场的视频提示词,一路到成片。

猫斯卡首页
猫斯卡首页

站内锁的是「谁」,每一场戏绑定谁的定妆图、哪张场景图,有参考图的人物不再用文字描写外观,脸和衣服靠图锁住。

ReShot 锁的是「怎么动」。

两样凑在一起,一场戏里的人和动作都有了着落,剩下交给视频模型的只有光线和画风。

猫斯卡的人物 tab,一集的定妆图墙
猫斯卡的人物 tab,一集的定妆图墙

深度动作捕捉这一步,我们不觉得它该锁在任何一家的付费墙后面。

它是整个行业都用得上的基础件,做扎实一次,大伙儿都省事。

所以连模型选型、内存模型、三家规格的预设、网页、ComfyUI 节点,一起给出去,Apache-2.0,商用不用问。

GitHub 搜 maosika-ai/reshot,或者直接 pip install reshot

用得顺手给个 star,哪家模型的参考视频规格变了,提个 issue,咱跟着改预设。

链接

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com