移植自 mac-agent-os 的 mediacrawler_adapter:不起子进程、不开页面,用浏览器里那份
登录态直接调抖音 Web 接口。产物键名照抄 store/douyin,所以 ingest 那条链路一个字不用改。
**目前能用的(真环境实测,非推断)**:
profile/other : 200, 7075 字节 —— 博主主页指标(粉丝/获赞/作品数/昵称)
aweme/detail : 200, 45425 字节 —— 单条作品详情(含点赞/评论/收藏/分享)
**目前不能用的:作品列表 `aweme/post`。** 两个互相独立的原因:
1. 这个接口被抖音单独升级成了真校验:不带 x-tt-argus 回 403「Uifid Not Found」,
带上 dummy 值回 200 + **空 body**。也就是说「头在不在」骗得过,「真校验」过不了。
同一套头打 profile/other 和 aweme/detail 都是通的 —— 抖音是挑着接口加保护的,
挑中的恰好是「批量拉作品列表」这个最敏感的动作。
2. 改走页面截获也不行:CDP 浏览器打开博主主页会落到「验证码中间页」(当天大量探测的
代价,过几小时要重测)。
所以现在的边界是:**已知作品的指标刷新能做,自动发现新作品做不了**。
**排查中控住变量后得到的两条事实**(都写进注释了):
· `Accept` / `Accept-Language` / `Referer` 才是主页接口能返回真数据的原因 —— 只有
UA+client hints+Cookie 时是 200 但仅 121 字节的空壳,补上这三个头变 7074 字节。
(我先前猜的 sec-ch-ua 不是关键。)
· 因此 UA 与 client hints 必须**成套地取自同一个浏览器**,所以 BrowserIdentity 一次
从 CDP 取齐 cookie + UA + hints,而不是各自写死。
「200 + 空 body 必须当场报错」也是刻意写死的:放过去它会在下游变成「这个博主没作品」,
把一次失败伪装成一条正常结果 —— 爬虫那条路正是这么栽的,还被翻译成「账号被封」。
测试 +11:cookie 解析、请求头成套性(含 uifid 缺失/回退)、产物键名与 store 对齐、
以及 _get 的三条失败路径(空 body / 403 带网关原话 / 正常返回)。
1.2 KiB
1.2 KiB
USER.md —— 关于你(模板)
本文件是模板,各机器运行 init.sh 后自动生成到 agent-local/identity/USER.md
如需修改用户信息,修改本模板后重新执行 init.sh --localize
- Name: USER_NAME
- What to call them: USER_NAME
- City: USER_CITY
工作背景
- 构建了完整的内容管理与自动化工具体系
- 核心:本地 Obsidian 知识库 + 第二大脑记忆系统
- 自动化工具覆盖小红书账号管理、知乎自动化
- 使用 Node.js 通过 WorkBuddy 执行脚本和自动化任务
- 金融数据检索需求频繁
个人偏好
- 偏好结构化输出(表格、编号列表)
- 决策果断直接,不需要反复确认
- 注重 token 效率和技能复用
- 倾向视觉化交互
- 期望直接执行结果,无需逐步授权
- 要求验证任务完成状态,主动检查遗漏项
当前关注
- AgentOS 多机协同架构落地
- 全平台内容归档助手方案
- 自动化流程稳定性
- 知识库体系持续进化
近期动态
- 搭建多平台自动化工具链
- 整合微信内容至本地 Obsidian 知识库
- 持续迭代 AgentOS 多智能体协同体系
版本: 3.0 | 最后更新: 2026-05-02