用户报「一直在运行中」。库里那条 run 是真的卡住了:日志里一条采集输出都没有, 说明它卡在 collect 里、还没走到任何日志。探针定位到: 标签页: [''] ← 一个 URL 为空的标签页,渲染进程已卡死 context.cookies(): OK, 90 个 ← cookie 读得到 page.evaluate('navigator.userAgent'): **永远不返回** 而问浏览器要身份(UA + client hints)是采集的**第一步**,`page.evaluate` 又**没设超时** —— 于是整轮挂在那儿,run 永远停在「运行中」。 三处修复,各挡一层: 1. `page.evaluate` / `context.cookies()` 全部加超时(8 秒)。卡住就跳过,不再无限等。 2. 不假设第一个标签页是好的:逐个试、优先抖音页;全都不行就临时开一个干净页问完关掉。 拿不到就退回库里那份 cookie —— **不编造指纹**,那比没有更糟。 3. **进程内那条路补上整体超时**:爬虫那条靠 `run_and_wait(timeout=...)` 兜底,这条路 没有子进程、没人管,里面任何一次卡住都会变成永久的「运行中」。 测试 +6:卡死的页会被跳过(真 sleep,验的正是超时)、没 UA 的页跳过、全不行时开临时页 并关掉它、优先抖音页;以及整轮卡住时 run 不会停在 running(含超时原因)。
移植自 mac-agent-os 的 mediacrawler_adapter:不起子进程、不开页面,用浏览器里那份 登录态直接调抖音 Web 接口。产物键名照抄 store/douyin,所以 ingest 那条链路一个字不用改。 **目前能用的(真环境实测,非推断)**: profile/other : 200, 7075 字节 —— 博主主页指标(粉丝/获赞/作品数/昵称) aweme/detail : 200, 45425 字节 —— 单条作品详情(含点赞/评论/收藏/分享) **目前不能用的:作品列表 `aweme/post`。** 两个互相独立的原因: 1. 这个接口被抖音单独升级成了真校验:不带 x-tt-argus 回 403「Uifid Not Found」, 带上 dummy 值回 200 + **空 body**。也就是说「头在不在」骗得过,「真校验」过不了。 同一套头打 profile/other 和 aweme/detail 都是通的 —— 抖音是挑着接口加保护的, 挑中的恰好是「批量拉作品列表」这个最敏感的动作。 2. 改走页面截获也不行:CDP 浏览器打开博主主页会落到「验证码中间页」(当天大量探测的 代价,过几小时要重测)。 所以现在的边界是:**已知作品的指标刷新能做,自动发现新作品做不了**。 **排查中控住变量后得到的两条事实**(都写进注释了): · `Accept` / `Accept-Language` / `Referer` 才是主页接口能返回真数据的原因 —— 只有 UA+client hints+Cookie 时是 200 但仅 121 字节的空壳,补上这三个头变 7074 字节。 (我先前猜的 sec-ch-ua 不是关键。) · 因此 UA 与 client hints 必须**成套地取自同一个浏览器**,所以 BrowserIdentity 一次 从 CDP 取齐 cookie + UA + hints,而不是各自写死。 「200 + 空 body 必须当场报错」也是刻意写死的:放过去它会在下游变成「这个博主没作品」, 把一次失败伪装成一条正常结果 —— 爬虫那条路正是这么栽的,还被翻译成「账号被封」。 顺带:把参考项目目录加进 .gitignore。上一次 `git add -A` 把 mac-agent-os-main 整个 (1429 个文件)带进了提交,已从历史里清掉。 测试 +11:cookie 解析、请求头成套性(含 uifid 缺失/回退)、产物键名与 store 对齐、 以及 _get 的三条失败路径(空 body / 403 带网关原话 / 正常返回)。