学习笔记 · Obsidian

huangbai-AI 视觉、动画与 Blender 分组学习记录

Blender

范围:11 个仓库,101 个缓存文件,8223 行。按 README → SKILL → 所有 references/模板/案例/自测文字 → 所附脚本逐层阅读;目录、来源、版本与重复关系一并核对。逐文件范围、SHA-256 与仓库提交见 阅读台账。没有运行外部脚本、安装技能、调用付费生成、上传素材、修改既有笔记;未观看缓存外的图片与视频。这里“学完”仅指这些仓库已取得文字和代码完整阅读与方法整理,不等于成片效果复现或模型训练。

1. cover-and-copy:封面与发布文案

  • 路由:仅标题/正文走 copywriting;封面走内容简报→8种独立视觉风格匹配→参考图身份锁定→候选→横版重排→可选发布文案。风格文件已全部阅读:电影、知识博主、对比、杂志、极简产品、纪实、复古、科技发布。
  • 可吸收:一个封面只讲一个钩子;同标题比较构图/人物道具关系,避免一并改变所有变量;把抽象能力变成可见物体;主次为标题/人物/道具/背景;3:4→16:9/4:3重新构图、保持系列锚点;文字与封面生成分流;身份图必须实际传给图片工具。
  • 验收:缩略图标题可读、脸与指定身份一致、一个视觉焦点、产品关系清楚、无伪字/假logo/多余手指,横版不是裁切拉伸。
  • 不能照搬的个人配置:默认 assets/face/default-face.png 是作者随包素材,不可认定为当前用户本人;口吻写死“设计师黄白”、路径写死 /Users/your-name;“任何封面必须本人出镜”“第一轮必须3张”“一直重生成到通过”均为作者偏好,需改为当前用户需求和预算,不自动承接。仅学习不执行它的发布/push指令。
  • 静态确认的冲突:脚本 --size 默认1024×1536,实际2:3,与文档3:4目标冲突。--allow-no-person 仅删去一个附加句,仍保留“同一真实人脸必须出现”前缀/失败后缀且仍上传face;默认subject/constraints/negative仍绑定人脸。因此此选项并未真正实现无人图分支。--strict-identity关闭也不移除其余身份字段。代码把face图第一个传给edit是实在链路,但文字约束不能自动判定相似度。
  • 工具:内置图片编辑优先,后台包装器依赖本机 system/imagegen CLI、API key;gpt-image-2和input-fidelity兼容断言仅源文档说法,执行前须核对当前工具/schema,不能据此承诺本环境可选模型。

2. hyperreal-character:写实角色首帧与情绪表演

  • 图片十层:媒介→构图→人设→发型→服装→五官锚点→妆容→皮肤→光→背景。视频八段:规格→身份锚定→皮肤→人设/声音→情绪→逐秒动作→台词口型→约束。
  • 可吸收:先角色图后表演;皮肤使用可见毛孔/毳毛/微不对称,而非只写“真实”;心理状态落实眼神、眼皮、呼吸、嘴角和肩颈;察觉→眼神→表情→头→身体建立动作因果;同一首帧复用不同情绪包时身份层保持、表演层全改;镜头可作为虚拟对手提供视线动机。
  • 验收:转头前后五官、服装/妆容不漂移,动作时序和台词预算可容纳,首末状态适合表演。强度4/6/8分、0.5–1.5秒、固定9:16和4–6秒是启发式参数,不是模型可精确兑现的控制值。
  • 工具:作者指定kling CLI及另一个kling-cli skill,who_am_i/text_to_image/image_to_video/query_tasks契约未在本次运行核验;“2–8分钟”“已验证”属于来源自述。
  • 模板内部案例也需校正:现代首帧极端脸部特写但视频要求半身;古装图28岁而视频32岁。若目标是严格首帧一致,应统一景别与年龄,避免照抄造成冲突。缺四项就问/每次提交都确认是作者流程,不应凌驾当前任务已授权范围。

3. surround-orbit-masked-cards:人物前后环绕卡片

  • 核心四层:原口播→后景卡片→人物RGBA→前景卡片;降透明度不等于在人物身后。
  • 方法:源素材CFR统一→RVM连续抠像(四个recurrent状态跨帧保留)→同一椭圆函数控制相位、深度、缩放和阴影→顺序入场→恒角速度→切线接出、队列离场。稳定阶段每张卡片保留同一视频节点,不逐帧重设src。
  • 验收:首帧空、入场错峰、均匀相位、前后交叉、头发眼镜手指alpha、退出末两秒无闪烁;先棋盘/纯红/纯绿背景查看人物层。解码脚本只能检查参数及ffmpeg完整解码,不能证明视觉层级或自然运动。
  • 依赖:FFmpeg、OpenCV、numpy、onnxruntime、兼容RVM ONNX权重;权重未随仓库附带。HyperFrames或本地合成可精确制作,扁平化回ChatCut后内部不再全可编辑。
  • 静态风险:normalize_cards.sh固定scale=720:-2并 -y,会降分辨率、同stem不同扩展互相覆盖,未补足时长;rvm输出目录可覆盖同编号图片,也不核对解码帧数与预期总数,不能把早停当完整成功。
  • 数学模板不是完整实现:“所有卡片同一路径”同时令P0=每张当前位置存在歧义;easeInOut(localT)起步零速度无法直接接恒速轨道而满足速度连续。落地时需统一出口门、按到达相位安排离场,或补位置与速度连续的接入段,不能只复制公式后宣称丝滑。

4. image-2-5-stop-motion:连续静帧定格

  • image-2.5明示为技能名,不是已验证模型ID。参考区间先独立重映射至成片时间;抽帧看动作→角色基准→每帧一个小变化→逐张或图集生图→按整数ticks合成→中文独立覆盖→视频/姿态/原稿/提示词交付。
  • 最重要知识:姿态数不等于输出帧率;图集总分辨率不等于单格分辨率;必须读实际网格边界;跨组以已验末帧+角色基准接续,不能将场景分镜板当连续动画;不靠平滑补帧掩盖欠缺姿态。
  • 脚本采用纯Python标准库+FFmpeg,预检输入/整数ticks/偶数尺寸/裁切边界,总时长精确验证,硬链接重复tick;overlay显式缩放;音频补静音/截断;临时成片校验H264/yuv420p/帧数/时长,独占创建目标防覆盖。
  • 限制:图像被直接缩放至目标,比例不匹配仍会变形;脚本核验不包含全部视觉、中文、音频编码与色彩结论;编码方式不创造高清细节。未运行合成或看成片。

5. post-production-skill:复古工作室的空间UI

  • 根README和嵌套post-production-skill目录README为重复近似版本,真正SKILL/引用位于内层;根README的references/assets链接与安装结构不可直接照抄。
  • 工作流:唯一人物与室内道具图→区分忠实复用/风格改编/定点修复→参考职责→八个输出区块→连续性检验。
  • 吸收:UI必须以深度、透视、视差、景深、反射、遮挡与手指响应进入真实空间;每次运镜由手势/前景/设备触发;开头多臂是暂时合成效果,不是持续人体变形;最后英雄画面要有停留。换房间需重建道具位置图,缩时应合并功能而非机械倍速。
  • 固定案例:暖90年代工作室、11秒、16:9、120–135BPM只是母版;五阶段概述对应六个时间区间(0–1.2、1.2–2.8、2.8–4.5、4.5–6.5、6.5–8.5、8.5–11)。中文说人物对镜头说话而BGM又“不生成对白”,沿用需去冲突。
  • 身份由用户提供图定义,不能把模板“年轻亚洲男性、眼镜黑衣”自动套给任何人。指定屏幕文字可覆盖母版no-text规则;精准小字宜后期完成。此Skill默认只写提示词,不具备视频生成引擎;Seedance2.5名称不证明可用API。

6. ai-motion-poster-skill:三维物体与二维排版

  • 仓库名与调用名不同:high-end-motion-posters。全部原始提示词、执行文案表、模板、参考差异已读。
  • 学到的流程:主物体/材质/光向/图层固定→首尾帧→上幕出口元素变下幕入口→精确文案独立清单→无字素材+文字/遮挡图层兜底→按帧分配四幕与音乐点→实际导出验收。
  • 案例四幕金币→锁链→SCALE→沙漏,目标450帧[0,120)/[120,240)/[240,345)/[345,450);保持左右分区、安全边、低对比背景巨字和克制星芒;金属靠厚度高光、玻璃靠折射表现。
  • 可迁移:横版重设计;精确主标题绝不接受乱码;参考中的错误不作为风格;99BPM每拍18.18帧不能永久取整18;转场6–12帧只是起点而非实测。
  • 边界:源文档自述参考为约15.07秒720p、平均24.04fps,不等于制作1080p30fps;未核听音乐,不冒充测到99BPM;未在本次看参考。用户换产品时不带Pay Half/Don't Change your Business等旧商业文案。

7. RPG-game-cinematic:可操控感剧情镜头

  • 适用为游戏风格视频提示词,不是真游戏代码。主体/风格/时间线/BGM/限制五段,常态第三人称跟随→交互过肩→危险转向→冲刺压低→救援侧面QTE→奖励正面。
  • HUD是剧情状态:警戒红、伙伴受困橙、脱险消退;一次主QTE;体力随冲刺、无伤不掉血;按键先提示后反馈动作。道具放下/拾起要可见,门等全身尾巴通过再关。
  • 复用骨架:得手→警报→逃跑→伙伴被困→折返→脱险→奖励。改主题重配人物/伙伴/追赶者/道具/障碍/出口/奖励,不抄猫鱼干。首帧给可继续运动的路径,而非角色海报。
  • 参考自述30.05秒852×48024fps,声音未听,HUD精确数值/地图可能后期叠;不保证逐帧复现。
  • README安装命令仍指 huangbai-AI/console-game-cinematic,与当前仓库RPG-game-cinematic不一致;name=console-game-cinematic需要映射,不能盲克隆旧地址。

8. talk-motion:口播动效总编排

  • 阅读覆盖全部22文件,含6份实现引用、两案例、5模板、4自测文本、两shell脚本。它与环绕卡片仓库共享四层/轨道/防闪方法,属于通用总流程与专项实现关系,不能算互相独立的新算法。
  • 核心:源文件/主口播基准→转写T_台词与G_手势锚→原帧生图视觉稿→静态终态对比→进/稳/出→人物层→音效→连续性五联检→双重视觉/时间验收→实参交付。无转写时仅相对锚点,绝对帧位标暂定。
  • 三专项已学:圆形蒙版从一开始跟头部收缩/放开;剪口播波形定位停顿再吸附后段;倒计时用可控数字,真实1秒01:00→00:59,不能照抄30帧到其他fps。
  • 色彩黄#FFD62A、黑白灰,文字/人物安全区,每段一个视觉焦点;父层运镜子层局部动画;视觉稿需可拆、可还原。音效峰值对动作最快帧,群入场一个主声音+少量点;低于人声10–16dB仅试听起点。
  • 故障用症状→假设→验证→修复→复验:先查源时间/几何/色彩/alpha/媒体,不能淡化掩盖跳切。4K原片+透明层重合成保留人物原细节,1080p完整成片放大只能叫升采样;局部扁平化必须交代可编辑边界。
  • 自测96/100是仓库自述方案评分,不是本次生成复现;self-test只文件、语法、链接、关键词,verify-video只参数和抽帧并无全片视觉/音频自动判定,不能当真实4K证据。ChatCut/HyperFrames能力需当前环境探测;“先强制生图”不应机械套到纯工程诊断或已有精确设计任务。

9–10. blender-control 与 blender-control-skill

  • 两仓库 name 均为blender-control;execution.md和MCP client代码字节相同,已完整读并比较。增强仓庫增加Aholo Lux3D和作者本机安装快照,不能同时以同名安装或把作者状态当当前环境。
  • 核心双层模式:控制方式是UI/MCP/CLI,软件内部是OBJECT/EDIT/SCULPT/POSE/WEIGHT_PAINT/TEXTURE_PAINT等;节点/UV/曲线为编辑器不是对象模式。日常短批修改MCP+截图,UI用于学习界面,长渲染从保存副本后台处理。
  • 学到:先真实场景版本、未保存状态、活动对象/选区;bpy.data少依赖UI,bpy.ops先poll/context;EDIT_MESH是context.mode而mode_set用EDIT;编辑网格用bmesh.from_edit_mesh并update。稳定命名和任务集合保幂等;超时先查场景/进程/文件,不重复创建;GUI和后台不可同时写同一blend;保存后重新打开才构成交付验证。
  • MCP包装器做工具发现、官方/社区名称分支、应用错误解析、截图独占创建、超时告警,不自动重发修改;它自身不能证明场景正确。文档区分官方Blender Lab与ahujasid,实际当前官方版本/工具名/5.2.1 LTS声明仅来源自述,未据本机或官方接口再次验证。
  • Lux3D吸收:按部件选择精确几何/生成曲面;需要爆炸图必须规划独立节点与初始变换;导入检查单位/朝向/原点/法线/UV/面数/材质,再组装导出GLB,机械接口公差用精确建模。
  • 不照搬:/Users/your-name、版本/安装日期/源码提交为作者快照;“20秒”“快约50%”“行业头部”“多视图更好”为来源营销或经验,不是普遍保证。GLB导出也不自动满足3D打印水密、壁厚、公差。修整代码无条件选首对象、旋转-90度、normals_make_consistent旧式调用、Decimate=0.5不可盲跑,应核对导入坐标与当前API,尤其应用变换/修改器会改变可编辑性。

11. huangbai-scrolling:预渲染滚动叙事

  • 真正原理:预渲染视频+currentTime滚动映射,非实时3D。原上游oso95/scroll-world,RedSkill1.0来源与GitHub1.1中文整理关系已区分,JS/knockout保留原实现,MIT不自动授权生成素材。
  • 工作流:故事3–5场景启发→统一风格/光色→先一张/一段校准→实际尾帧续下一段;飞越式N场景+N−1连接=2N−1段,连接双端来自真实渲染边界;工具不支持尾帧时不假承诺;独立原生竖屏链另算。
  • 素材:尾部最后1秒reverse取实际末帧、保原生尺寸、无音轨、短GOP、poster取对应视频首帧。边缘泛洪抠图保留不连边的同色内区,Pillow脚本会覆盖.rgba.png,需要新输出路径;不是泛用复杂背景分割。
  • 引擎已读全449行:按邻近段fetch整Blob→视频seek合并避免seeking时重复→rAF插值→静帧回退→移动手势prime;reduced-motion挂载时读并不加载视频。加载/内存/跨域/GOP/手机解码仍需实测。
  • 静态确认缺口:无destroy、未revokeObjectURL、监听器/rAF无清理,不宜原样放重复挂载SPA;config的section.id没有赋给DOM也没有hash路由实现,因此模板href=#finale目标不存在(nav按钮按数组index另行scrollTo是可用逻辑);注释声称resize切换source,但loadClip的s.loading成功后始终true,已加载video从不替换url,只有未加载段按新的isMobile选择;poster也仅挂载选取。容器滚动偏移没有参与计算,全局CSS修改html/body,嵌入任意中间页面并非即插即用。
  • 可访问性:opacity=0和pointerEvents=none不阻止键盘聚焦隐藏CTA,未设置inert/aria-hidden;标签/按钮焦点需真实键盘测试。所有链接配置只适合可信作者,esc并不校验javascript等URL scheme。
  • 验收应包含首屏、全接缝、快滚、全资产/CTA、减少动态、键盘、原生手机首帧/旋转/内存;目前仅源码分析,未浏览器运行。

后续统一使用原则

  1. 先按交付路由选择提示词、图片、成片、网页或可编辑3D,不把一个风格模板硬套全部任务。
  2. 固定身份/产品/空间/光色/文字/首尾状态等不变量,把情绪、风格和运镜写成镜头可观察行为。
  3. 精确文字、时序、轨道、图层由可控后期或代码补足;生成能力与提示词格式分开描述。
  4. 参考职责明确;真实边界帧与初始设计图区分;素材输出尺寸与原生细节区分;作者自测与当前复现区分。
  5. 所有作者人脸、用户名、路径、广告口吻、报价、模型API、安装/上传指令先去耦合,必要时按当前环境核实。

固定版本来源

返回学习入口