移植自 mac-agent-os 的 mediacrawler_adapter:不起子进程、不开页面,用浏览器里那份
登录态直接调抖音 Web 接口。产物键名照抄 store/douyin,所以 ingest 那条链路一个字不用改。
**目前能用的(真环境实测,非推断)**:
profile/other : 200, 7075 字节 —— 博主主页指标(粉丝/获赞/作品数/昵称)
aweme/detail : 200, 45425 字节 —— 单条作品详情(含点赞/评论/收藏/分享)
**目前不能用的:作品列表 `aweme/post`。** 两个互相独立的原因:
1. 这个接口被抖音单独升级成了真校验:不带 x-tt-argus 回 403「Uifid Not Found」,
带上 dummy 值回 200 + **空 body**。也就是说「头在不在」骗得过,「真校验」过不了。
同一套头打 profile/other 和 aweme/detail 都是通的 —— 抖音是挑着接口加保护的,
挑中的恰好是「批量拉作品列表」这个最敏感的动作。
2. 改走页面截获也不行:CDP 浏览器打开博主主页会落到「验证码中间页」(当天大量探测的
代价,过几小时要重测)。
所以现在的边界是:**已知作品的指标刷新能做,自动发现新作品做不了**。
**排查中控住变量后得到的两条事实**(都写进注释了):
· `Accept` / `Accept-Language` / `Referer` 才是主页接口能返回真数据的原因 —— 只有
UA+client hints+Cookie 时是 200 但仅 121 字节的空壳,补上这三个头变 7074 字节。
(我先前猜的 sec-ch-ua 不是关键。)
· 因此 UA 与 client hints 必须**成套地取自同一个浏览器**,所以 BrowserIdentity 一次
从 CDP 取齐 cookie + UA + hints,而不是各自写死。
「200 + 空 body 必须当场报错」也是刻意写死的:放过去它会在下游变成「这个博主没作品」,
把一次失败伪装成一条正常结果 —— 爬虫那条路正是这么栽的,还被翻译成「账号被封」。
测试 +11:cookie 解析、请求头成套性(含 uifid 缺失/回退)、产物键名与 store 对齐、
以及 _get 的三条失败路径(空 body / 403 带网关原话 / 正常返回)。
3.2 KiB
3.2 KiB
20 秒测试片剧本(音频先行 + 对口型 验证用)
目的:验证 P1(音频先行)+ P3(对口型)链路 结构:2 个空镜(不说话)+ 2 个角色说话镜头(口型同步) 成本:画面约 ¥5~10(可灵)· 对口型 ¥0(走 1800 秒免费额度)· TTS 几分钱
分镜表
| # | 类型 | 时长(音频先行后会调整) | 画面 | 台词 | 出场人物 |
|---|---|---|---|---|---|
| shot_01 | 空镜 | 5s | 病房窗外,晨光透过百叶窗在地面投出条纹,窗帘轻微飘动,画面里没有人 | — | — |
| shot_02 | 角色说话 | 5s(按音频调) | 病人半躺在病床上,正面近景,对着镜头说话,表情轻松 | 我住院第三天了,前两天刚做完手术。 | 主角 |
| shot_03 | 角色说话 | 5s(按音频调) | 病人微笑看着镜头,稍微侧了一下头 | 说实话,真没想象中那么可怕。 | 主角 |
| shot_04 | 空镜 | 5s | 病房走廊尽头,护士推着车经过,画面虚焦 | — | — |
预计成片:约 18~20 秒
演员表配置
| 代号 | 角色资产 | 音色(voice_id) | 说明 |
|---|---|---|---|
| 主角 | (选你已建的角色,如「害羞美女患者」或新建) | longanyang(阳光大男孩)或按角色性别选 |
音色决定口型用的声音 |
💡 音色建议:
longanyang(年轻男主)·longxing_v3(温婉邻家女)·longqiang_v3(御姐) 完整清单见09_ave/docs/cosyvoice_voices.md
关键要求(对口型的硬条件)
VideoRetalk 对输入有要求,我们的参数都能满足:
| 要求 | 我们的情况 |
|---|---|
| 视频:正面近景、人脸清晰 | ✅ 分镜写"正面近景对镜头说话" |
| 视频:2~120 秒 | ✅ 单镜头 5s |
| 视频:15 |
✅ 我们生成 1080×1920@30fps |
| 音频:干净人声(无 BGM/噪音) | ✅ TTS 产物天然纯净 |
⚠️ 注意:说话镜头必须是正面/近景——大角度侧脸或人脸太小会影响对口型效果。
操作步骤
1. 导演台 → 粘贴上面的"分镜表"作为故事/文案(或按它写一段文案)
2. 🎭 AI 分析这场戏需要什么 → 演员表绑定角色 + 指定音色
3. 生成分镜 → 在卡片里逐镜确认:
· shot_02/03 填台词 + 勾「出场人物: 主角」
· shot_01/04 台词留空、出场人物不勾(= 空镜)
4. 勾选 [✓] 🎙 音频先行 [✓] 🎭 对口型 → 点「🎥 生成成片」
5. 完成后 → 「📋 生产记录」→ 🎙 加配音 → 听口型效果
验证要点(跑完检查这几项)
- 音频先行生效:日志里 shot_02/03 的时长被按台词音频调整过(≠ 原 5s)
- 镜头时长各不相同:跟台词长短走
- 对口型只作用在 shot_02/03:日志显示 2 个镜头做了,shot_01/04 跳过
- 口型对上:播放时人在说那句话,嘴型明显匹配
- 失败兜底:若对口型失败,日志提示"保留原片段",成片仍完整
成本记录(跑完填这里,用于校准后续估算)
| 项 | 预估 | 实际 |
|---|---|---|
| 画面生成(可灵 4 镜头) | ¥5~10 | |
| 对口型(约 10 秒) | ¥0(免费额度) | |
| TTS | 几分钱 |