声音设计知识(叙事规划 + 后期参考)

SkillMedia

Sound design knowledge—ambience/sound effects/score mood/silence design/auditory motifs (leitmotif)/audiovisual counterpoint—for narrative planning and post-editing reference only; ⚠️ video generation prompts contain no audio, so this content is not written into shot prompts—it's for Nomi's timeline

Available today. Use it from your connected AI after setup.

Connect ahel once, and every AI you use reads what you have installed.

Then ask your AI: use the 声音设计知识(叙事规划 + 后期参考) skill

What this skill tells your AI

The instructions your AI receives, as published by aqm857886159/nomi in skills/director-sound/SKILL.md and read by ahel’s review.

先读这一条:这套知识不写进视频提示词

视频生成模型的提示词不含音频——环境音、音效、配乐、台词都不在画面模型的能力范围里,写进去要么被忽略、要么污染画面。所以这个技能的产出绝不写进 shot 的 prompt。

它服务两个阶段:

  • 叙事规划阶段:给角色建声音标签、给场景设声音签名、规划听觉记号,作为一层薄薄的「听觉设计意图」跟着分镜走。它是规划时的参考,不是要塞进任何生成字段。
  • Nomi 时间轴后期阶段:等画面生成好、进了 Nomi 时间轴,用于音频轨的后期配音 / 音效 / 配乐规划——按这套方法给每段画面配底层环境声、中层间歇声、前层动作音效,选配 BGM 情绪曲线。

核心理念:观众闭上眼睛也应该能「听出」这是哪个场景、谁在说话、现在是什么情绪。 声音不是画面的附属品,是独立的叙事层。

角色声音标签

给每个主要角色一套声音标签,作为规划参考、后期配音时照它统一。四个维度:

  1. 说话节奏 — 语速(快/中/慢/极慢);停顿习惯(频繁停顿/流利不停/关键词前停顿);句长(短句 ≤5 字 / 中句 / 一口气长句)。
  2. 声线特征 — 音高(低沉/中等/偏高);质感(沙哑/清亮/鼻音重/气声);力度(轻声/正常/有力/压着嗓子)。
  3. 情绪表达方式 — 外放型(生气会吼、开心笑出声)/ 内收型(生气压低音量、开心只语调微升)/ 极端内收(任何情绪几乎不改变声线)。
  4. 标志性声音习惯 — 说话前清嗓、句尾叹气、思考时「嗯」的鼻音等。小习惯给角色「声音辨识度」。

记录格式示例(全片保持一致):

角色语速句长声线情绪表达标志习惯
角色A中偏快短句平板单调极端内收说完话后沉默·语气几乎无起伏
角色B≤5 字低沉厚重内收句尾带鼻音哼声

环境音层次设计

每个场景的声音由三层构成,从远到近:

底层(Ambience / Room Tone) — 持续不变的背景声,定义「这是什么空间」,同一场景全程一致。例:

  • 走廊:引擎/管线低频嗡鸣 + 远处液冷循环声
  • 舰桥/机房:多终端低频电子嗡声 + 空调系统低鸣
  • 静室/卧室:远处设备极弱低鸣 + 空气循环微弱气流声
  • 户外空旷 / 深空:接近或完全寂静——寂静本身就是空间的声音签名

中层(Specific Sounds) — 间歇出现,增加真实感:广播通知、远处脚步、门的开合、杯子落桌、设备蜂鸣。

前层(Foreground / Action Sounds) — 角色动作产生、与画面动作精确同步:脚步声(不同材质地面声音不同)、呼吸声(平静/急促/屏气)、操作声(按钮/触屏/翻页/拉杆)。

场景声音签名

给每个场景定义一个声音签名——一听就知道「到了这里」。在角色第一次进入该场景时建立,后续每次回到都保持一致:

场景底层特征音情绪感受
舰桥/机房引擎低鸣 + 终端嗡声键盘敲击、投影嗞嗞声冷静有序的技术空间
医护/维生区循环泵脉冲 + 密封吱呀偶尔气泡上升、辅助设备嘶嘶令人不安的安静·机械维生感
主角独处的房间远处低鸣空气循环微弱气流独处的安全感·极简

听觉记号(Sound Motif / Leitmotif)

一个反复出现的声音元素,每次出现承载不同含义——和视觉母题(反复出现的物件)是同一逻辑。

设计原则

  • 一部作品 2-3 个听觉记号就够,太多失去辨识度。
  • 首次出现要足够清晰,让观众「记住」这个声音。
  • 后续出现可变形(速度变化、混响变化、叠加其他声音)。
  • 最后一次出现应有「回收」感——回到最初形态,或彻底变形。

示例

  • 某段引擎启动声:第一次 = 任务开始;中段 = 逃离;结尾 = 归途。
  • 某段循环水声:初到 = 陌生不适;适应期 = 平静背景;危机期 = 戛然而止。

硬规则:听觉记号限定在声效层(环境声/机械声/自然声/角色签名声),不包括音乐旋律——旋律属于后期配乐工序。

配乐(BGM)情绪

BGM 是后期独立工序,不在任何视频生成环节。规划时只需给出情绪曲线(哪段紧张、哪段舒缓、哪段留白),到 Nomi 时间轴后期按曲线选配或整段留白:

情绪段落配乐倾向常见手法
开场/铺垫克制、留白少量氛围垫底,或纯环境声无 BGM
推进/悬疑低频脉动、渐强持续低音 + 逐渐加密的节奏
高潮/爆发满配、强节奏打击乐/弦乐齐上,与硬同步音效叠
收尾/落点回收主题、渐弱呼应开场动机,留一段安静收束

声画同步

  • 硬同步(Hard Sync) — 声音与动作精确对齐(拳到的瞬间听到撞击)。用于动作、打击、爆炸、门的开合、物体碰撞。
  • 软同步(Soft Sync) — 情绪上匹配、不精确到帧。用于环境音随场景渐变、音乐跟随情绪起伏。
  • 反向同步(Counter Sync) — 声音与画面情绪相反(画面暴力但声音安静,或画面安静但声音紧张)。制造不安、讽刺、超现实感——极强的叙事工具,慎用。

沉默的使用:突然的寂静比任何声音都更有力量。用在震惊、顿悟、死亡、时间凝固。原则:寂静之前必须有声音(有对比才有效果),持续一般不超过 2-3 秒。

后期配音描述(给 Nomi 时间轴音频轨用,不写进生成提示词)

进了 Nomi 时间轴后,按三层给每段画面写配音说明:

底层:[场景声音签名的底层描述]
环境:[中层间歇声音]
动作音效:[前层动作声音,与画面动作对应]

示例:

底层:走廊的引擎持续低频嗡鸣,管线液冷循环声若隐若现。
环境:远处偶尔传来门开合的沉闷声,走廊尽头有人说话的模糊回响。
动作音效:角色A靴子踩金属地板的均匀脚步声——每步间隔约一秒。

一句话收束

  • 声音标签 / 场景签名 / 听觉记号都是规划参考 + 后期指导,全片保持一致,不进视频提示词
  • 场景签名在首次出现该场景时建立;听觉记号与视觉母题并列规划。
  • BGM 是后期独立工序,规划只给情绪曲线,落地在 Nomi 时间轴的音频轨。
  • AI 视频生成对声音控制力有限——精确的声音设计更多是给 Nomi 后期的指导。

Signals

GitHub stars
507
Forks
109
Last commit
Sep 2026
Advanced
Catalog kind
skill
Gateway key
director-sound
Source
github.com/aqm857886159/nomi
声音设计知识(叙事规划 + 后期参考) (director-sound): Skill · ahel