Files
MediaCrawler/mac-agent-os-main/PLANS/TEST_20S_SCRIPT.md
T
butubb 2112c1a870
Deploy VitePress site to Pages / build (push) Canceled after 0s
Deploy VitePress site to Pages / Deploy (push) Canceled after 0s
feat(monitor): 抖音 Web 接口客户端 —— 绕开爬虫子进程,直接发 HTTP
移植自 mac-agent-os 的 mediacrawler_adapter:不起子进程、不开页面,用浏览器里那份
登录态直接调抖音 Web 接口。产物键名照抄 store/douyin,所以 ingest 那条链路一个字不用改。

**目前能用的(真环境实测,非推断)**:

    profile/other : 200, 7075 字节  —— 博主主页指标(粉丝/获赞/作品数/昵称)
    aweme/detail  : 200, 45425 字节 —— 单条作品详情(含点赞/评论/收藏/分享)

**目前不能用的:作品列表 `aweme/post`。** 两个互相独立的原因:
  1. 这个接口被抖音单独升级成了真校验:不带 x-tt-argus 回 403「Uifid Not Found」,
     带上 dummy 值回 200 + **空 body**。也就是说「头在不在」骗得过,「真校验」过不了。
     同一套头打 profile/other 和 aweme/detail 都是通的 —— 抖音是挑着接口加保护的,
     挑中的恰好是「批量拉作品列表」这个最敏感的动作。
  2. 改走页面截获也不行:CDP 浏览器打开博主主页会落到「验证码中间页」(当天大量探测的
     代价,过几小时要重测)。

  所以现在的边界是:**已知作品的指标刷新能做,自动发现新作品做不了**。

**排查中控住变量后得到的两条事实**(都写进注释了):
  · `Accept` / `Accept-Language` / `Referer` 才是主页接口能返回真数据的原因 —— 只有
    UA+client hints+Cookie 时是 200 但仅 121 字节的空壳,补上这三个头变 7074 字节。
    (我先前猜的 sec-ch-ua 不是关键。)
  · 因此 UA 与 client hints 必须**成套地取自同一个浏览器**,所以 BrowserIdentity 一次
    从 CDP 取齐 cookie + UA + hints,而不是各自写死。

「200 + 空 body 必须当场报错」也是刻意写死的:放过去它会在下游变成「这个博主没作品」,
把一次失败伪装成一条正常结果 —— 爬虫那条路正是这么栽的,还被翻译成「账号被封」。

测试 +11:cookie 解析、请求头成套性(含 uifid 缺失/回退)、产物键名与 store 对齐、
以及 _get 的三条失败路径(空 body / 403 带网关原话 / 正常返回)。
2026-10-10 17:12:25 +08:00

3.2 KiB
Raw Blame History

20 秒测试片剧本(音频先行 + 对口型 验证用)

目的:验证 P1(音频先行)+ P3(对口型)链路 结构:2 个空镜(不说话)+ 2 个角色说话镜头(口型同步) 成本:画面约 ¥5~10(可灵)· 对口型 ¥0(走 1800 秒免费额度)· TTS 几分钱


分镜表

# 类型 时长(音频先行后会调整) 画面 台词 出场人物
shot_01 空镜 5s 病房窗外,晨光透过百叶窗在地面投出条纹,窗帘轻微飘动,画面里没有人 — —
shot_02 角色说话 5s(按音频调) 病人半躺在病床上,正面近景,对着镜头说话,表情轻松 我住院第三天了,前两天刚做完手术。 主角
shot_03 角色说话 5s(按音频调) 病人微笑看着镜头,稍微侧了一下头 说实话,真没想象中那么可怕。 主角
shot_04 空镜 5s 病房走廊尽头,护士推着车经过,画面虚焦 — —

预计成片:约 18~20 秒


演员表配置

代号 角色资产 音色(voice_id) 说明
主角 (选你已建的角色,如「害羞美女患者」或新建) longanyang(阳光大男孩)或按角色性别选 音色决定口型用的声音

💡 音色建议:longanyang(年轻男主)· longxing_v3(温婉邻家女)· longqiang_v3(御姐) 完整清单见 09_ave/docs/cosyvoice_voices.md


关键要求(对口型的硬条件)

VideoRetalk 对输入有要求,我们的参数都能满足:

要求 我们的情况
视频:正面近景、人脸清晰 ✅ 分镜写"正面近景对镜头说话"
视频:2~120 秒 ✅ 单镜头 5s
视频:1560fps、边长 6402048 ✅ 我们生成 1080×1920@30fps
音频:干净人声(无 BGM/噪音) ✅ TTS 产物天然纯净

⚠️ 注意:说话镜头必须是正面/近景——大角度侧脸或人脸太小会影响对口型效果。


操作步骤

1. 导演台 → 粘贴上面的"分镜表"作为故事/文案(或按它写一段文案)
2. 🎭 AI 分析这场戏需要什么 → 演员表绑定角色 + 指定音色
3. 生成分镜 → 在卡片里逐镜确认:
   · shot_02/03 填台词 + 勾「出场人物: 主角」
   · shot_01/04 台词留空、出场人物不勾(= 空镜)
4. 勾选 [✓] 🎙 音频先行  [✓] 🎭 对口型 → 点「🎥 生成成片」
5. 完成后 → 「📋 生产记录」→ 🎙 加配音 → 听口型效果

验证要点(跑完检查这几项)

  • 音频先行生效:日志里 shot_02/03 的时长被按台词音频调整过(≠ 原 5s)
  • 镜头时长各不相同:跟台词长短走
  • 对口型只作用在 shot_02/03:日志显示 2 个镜头做了,shot_01/04 跳过
  • 口型对上:播放时人在说那句话,嘴型明显匹配
  • 失败兜底:若对口型失败,日志提示"保留原片段",成片仍完整

成本记录(跑完填这里,用于校准后续估算)

项 预估 实际
画面生成(可灵 4 镜头) ¥5~10
对口型(约 10 秒) ¥0(免费额度)
TTS 几分钱