← 返回 Blender 场景页H3 记忆实验主页

能改吗?能动吗?把 Blender 场景用于视频编辑,并尝试把动态内容也建模

在 GPT-6 Astra 搭好的房间上做了三种编辑、一次“改首帧再让 H3 重新生成”的视频编辑,以及动态内容的逐帧三维抬升

2026-10-07 · 场景 robot_bedroom · H3 视频:种子 42,换朝向回访轨迹 · 场景本身的搭建过程见 Blender 场景页

3 种编辑:改材质、改位置和朝向、一句话换家具
4 分钟一句话编辑:Astra 用时 232 秒、$0.84,一次成功
5 / 5编辑后,自由摆放的物体仍全部通过物理静置测试
1.80 m抬升出的机器人顶部高度(正面视角逐帧稳定在 ±1%)

结论速览

改材质、改位置朝向、一句话换家具

原场景
原场景(Astra 搭建,加物理检查后的第 1 轮)
编辑 A
编辑 A · 改材质:被子和枕头改成深绿(保留条纹),墙和天花板改成浅暖灰,地板改成深胡桃色
编辑 B
编辑 B · 改位置和朝向:床组整体前移 35 cm 并转 20°,右床头柜连同上面的书和毛巾转 −35°
编辑 C
编辑 C · 一句话换家具:“把两个黑色床头柜换成圆形浅橡木独腿边桌,右边加一盏台灯”
编辑怎么改用时编辑后物理检查
A 改材质参数化:按亮度把材质节点里的颜色映射到新色调,程序化条纹和木纹保留;墙和天花板直接换成纯色材质几秒,渲染约 10 秒全部稳定
B 改位置和朝向参数化:按实例编号整体平移、绕竖直轴旋转;放在床头柜上的书和毛巾按名字一起带走几秒全部稳定(床位移 0.03%)
C 一句话换家具Astra 读当前脚本和三张渲染图,按指令改写脚本,驱动重新搭建、渲染、导出232 秒,$0.84,一次成功全部稳定

编辑 C 里 Astra 自己写的修改说明(摘译):“只替换两个柜子,改成 45 cm 的浅橡木独腿边桌,保留原来的中心位置、桌面高度和实例标签;书和毛巾留在原处,在右桌后侧的空位加一盏暖光陶瓷台灯;其余不动。”

编辑能“指哪改哪”,靠的是搭建时留下的结构:每个物体按“编号_类别_部件”命名,带类别、能否移动和质量。开门这类关节编辑还需要知道铰链在哪里,可以让 Astra 在搭建时给门加一个铰链空物体。

编辑 B 房间内视角
编辑 B 的房间内视角:床斜着摆在墙前。
编辑 C 房间内视角
编辑 C 的房间内视角:两张圆边桌和台灯。
四个版本沿 H3 的同一条相机轨迹渲染:改动在任何视角下都同步、前后一致,这是三维表示天然具备的。

用来做视频编辑

实测:改首帧,再让 H3 重新生成

原输入
原输入(H3 的第 0 帧)。
编辑后的输入
编辑后的输入:编辑 A 的渲染,加上原图里的两个机器人(SAM 3 抠出,边缘羽化)。

提示词同步改成“浅暖灰墙、深胡桃木地板、深绿色条纹被子”,其余不变;种子和相机轨迹与原视频相同,不注入任何证据。

左:H3 原视频。右:首帧换成编辑 A 的场景后重新生成。
原视频与编辑后视频关键帧
关键帧:帧 0、54(第一次访问,左转 40°)、120(正前方)、198(第二次访问,左转 55°、下俯 12°)。点击看大图。

三条路线

路线做法现在能做吗保留原动作适合的编辑主要问题
改首帧,重新生成编辑场景 → 从第 0 帧相机渲染 → 贴回机器人 → H3 生成能(本页实测)否,同种子下相近材质、颜色、风格;远离机器人的物体增删画面偏 CG;动作和原视频不同;几何改动会和机器人的交互冲突
编辑后的场景当证据每一段都用编辑后场景的渲染当证据部分否需要多视角严格一致的编辑证据太强时机器人消失;场景要先补上第一次访问新看到的内容
合成每帧渲染编辑后的静态场景,把原视频的动态层(机器人、被子)按掩码和深度贴回组件都有,还没拼起来是,逐帧保留远离交互区域的静态编辑:墙、地板、窗、床头柜光照、阴影、接触不一致;被机器人操作的被子改不了

动态内容能不能建模

先试最直接的办法:逐帧把机器人和被子抬升到场景的米制坐标系里。每一帧做四步:

  1. DA3 估计深度。
  2. 在同一相机下渲染静态场景的深度,用地板像素上的比值确定这一帧的尺度。
  3. SAM 3 抠出机器人和被子,按尺度后的深度反投影到三维。
  4. 从一个新视角(右前方 1.7 m 高处)把这些点画进 Blender 静态场景。背景渲染时去掉了被子和枕头,因为视频里它们一直在被机器人搬动。
左:H3 原视频。右:抬升出的机器人和被子放进 Blender 静态场景,从右前方的新视角看。
动态抬升关键帧
关键帧:帧 0、54、120、198。被子落在床上,机器人站在床两侧;但只有朝向原相机的那一面,近处能看出是稀疏的点。

逐帧尺度:必须逐帧定标,用地板比用整幅场景稳

第一次访问 第二次访问 0.4 0.8 1.2 1.6 0 40 80 120 160 200 帧
整幅静态场景定标只用地板定标

DA3 每帧自己估的尺度会漂:正面约 0.46,左转时约 0.65,第二次访问时约 1.1,所以必须逐帧定标。用整幅静态场景定标时,镜头左转后会出错:H3 在那里按提示词画了门外的另一个房间,场景里却是一堵墙。只用地板定标更稳。

第一次访问 第二次访问 1.6 1.8 2 2.2 0 40 80 120 160 200 帧
整幅静态场景定标只用地板定标

机器人顶部高度(98% 分位)。正面视角两种定标都稳定在 1.80 m(绿色虚线);第一次访问时,整幅场景定标把机器人估高到 1.93 m,只用地板定标是 1.86 m。第二次访问时机器人被画面边缘截掉一部分,这一段的高度只能作参考。

要真正建模动态内容,分四级

级别得到什么怎么做投入和风险参考
0 · 逐帧 2.5D 抬升(本页)每帧一层带颜色的表面点,米制、和场景对齐深度 + 掩码 + 已知相机,用场景地板定标已完成—
1 · 关节化机器人每个机器人一套带骨骼的完整网格,每帧一个姿态;能从任意视角重渲染、换外观、改动作逐帧估计人形姿态(机器人是人形,可先试人体模型),绑定到 Astra 搭的机器人模型上1–3 天;人体模型可能认不准机器人外观,手和被子的接触难Human3R(2510.06219,开源权重)、JOSH(2501.02158)
2 · 可形变的被子每帧一张被子网格以 Astra 的被子网格为模板,按每帧深度和掩码做非刚性跟踪;或用 Blender 布料仿真,由机器人手的轨迹驱动数天以上,偏研究—
3 · 通用四维表示能从新视角回放的动态场景,但不能按物体编辑4D 高斯、多视角视频扩散视方法而定4DGS(2310.08528)、CAT4D(2411.18613)

级别 1 做成后能一举两得。第一,证据里有了机器人,H3 在完整场景证据下就不会再把机器人抹掉,因为它会照着证据画,连机器人一起画。第二,视频编辑可以保留原动作:改场景,按原动作重渲染 CG 代理,再让 H3 把代理“画”成真实画面。这和 UniMoCa(2608.01944)用三维代理视频控制生成、Wan-Animate(2509.14055)替换角色而保留动作是同一个方向;区别是这里用不训练的证据注入,代替它们训练出来的控制分支。

建议的下一步

  1. 场景同步:第一次访问后,把新看到的内容(门、绿植、书桌)补进场景,可以让 Astra 参照第 54 帧补建,也可以由慢速环抬升;之后再给回访当证据。
  2. 证据强度控制:减少注入层数、只在回访片段注入、给证据加噪声、限制证据 token 占比。
  3. 视频编辑先走两条已经可行的路:材质和风格类编辑用“改首帧再生成”;需要保留原动作的静态编辑用合成路线。
  4. 机器人关节化(级别 1):先在节点上装 Human3R,测它对人形机器人的姿态估计效果。