移植自 mac-agent-os 的 mediacrawler_adapter:不起子进程、不开页面,用浏览器里那份
登录态直接调抖音 Web 接口。产物键名照抄 store/douyin,所以 ingest 那条链路一个字不用改。
**目前能用的(真环境实测,非推断)**:
profile/other : 200, 7075 字节 —— 博主主页指标(粉丝/获赞/作品数/昵称)
aweme/detail : 200, 45425 字节 —— 单条作品详情(含点赞/评论/收藏/分享)
**目前不能用的:作品列表 `aweme/post`。** 两个互相独立的原因:
1. 这个接口被抖音单独升级成了真校验:不带 x-tt-argus 回 403「Uifid Not Found」,
带上 dummy 值回 200 + **空 body**。也就是说「头在不在」骗得过,「真校验」过不了。
同一套头打 profile/other 和 aweme/detail 都是通的 —— 抖音是挑着接口加保护的,
挑中的恰好是「批量拉作品列表」这个最敏感的动作。
2. 改走页面截获也不行:CDP 浏览器打开博主主页会落到「验证码中间页」(当天大量探测的
代价,过几小时要重测)。
所以现在的边界是:**已知作品的指标刷新能做,自动发现新作品做不了**。
**排查中控住变量后得到的两条事实**(都写进注释了):
· `Accept` / `Accept-Language` / `Referer` 才是主页接口能返回真数据的原因 —— 只有
UA+client hints+Cookie 时是 200 但仅 121 字节的空壳,补上这三个头变 7074 字节。
(我先前猜的 sec-ch-ua 不是关键。)
· 因此 UA 与 client hints 必须**成套地取自同一个浏览器**,所以 BrowserIdentity 一次
从 CDP 取齐 cookie + UA + hints,而不是各自写死。
「200 + 空 body 必须当场报错」也是刻意写死的:放过去它会在下游变成「这个博主没作品」,
把一次失败伪装成一条正常结果 —— 爬虫那条路正是这么栽的,还被翻译成「账号被封」。
测试 +11:cookie 解析、请求头成套性(含 uifid 缺失/回退)、产物键名与 store 对齐、
以及 _get 的三条失败路径(空 body / 403 带网关原话 / 正常返回)。
4.8 KiB
4.8 KiB
系统监控面板 (10_dashboard) 架构设计
版本: 1.0.0 | 更新: 2026-05-16 定位: 系统级监控层, 联邦架构可视化面板
一、架构总览
10_dashboard/ ← 系统级监控面板
├── app.py FastAPI 后端 (插件注册 + API 路由)
├── run.py 独立启动入口
├── config.yaml (预留) 数据源配置
├── static/index.html 前端 SPA
├── plugins/
│ ├── __init__.py 插件管理器
│ ├── base.py DashboardPlugin 基类
│ └── ave.py AVE 视频工厂数据源插件
└── PLANS/ARCHITECTURE.md 本文件
二、数据流
┌─────────────────────────────────────────────────┐
│ 用户浏览器 (SPA) │
└─────────────────┬──────────────┬────────────────┘
│ GET /api/* │
▼ ▼
┌─────────────────────────────────────────────────┐
│ 10_dashboard/app.py (FastAPI) │
│ │
│ /api/plugins → 插件列表 │
│ /api/summary → 所有插件聚合总览 │
│ /api/productions → AVE 插件 │
│ /api/assets/* → AVE asset_manager │
│ /api/costs/* → AVE 插件 │
└─────────┬──────────────────────┬──────────────────┘
│ │
▼ ▼
┌──────────────┐ ┌──────────────────┐
│ AVE 插件 │ │ (未来) Matrix │
│ plugins/ave.py│ │ guardd / 其他 │
│ → AVE DB │ │ → 各自 DB/API │
└──────────────┘ └──────────────────┘
核心原则:
- 数据不搬家: Dashboard 只读, 不复制数据
- 插件隔离: 每个模块的数据源在自己的 plugin 中处理
- 增量接入: 新模块只需实现 DashboardPlugin 基类
三、插件协议
class DashboardPlugin:
name: str # "ave", "matrix", "guardd"
label: str # "视频工厂", "矩阵养号", "系统状态"
order: int # 展示排序
def get_summary(self) -> dict
def get_productions(self, limit, offset, strategy, status) -> list
def get_production_detail(self, id) -> dict|None
def get_cost_breakdown(self) -> list
def get_sidebar_links(self) -> list[dict]
def is_available(self) -> bool
四、与 AVE 的边界
| 组件 | 归属 | 说明 |
|---|---|---|
lib/dashboard.py |
09_ave | AVE 数据写入层 (production/step/asset/cost 埋点) |
asset_manager/ |
09_ave | AVE 素材索引 (AssetIndex/CacheManager/AssetSearch) |
cost_tracker.py |
09_ave | AVE 费用追踪 |
plugins/ave.py |
10_dashboard | AVE 数据读取适配器 |
app.py |
10_dashboard | 系统级后端, 加载所有插件 |
static/index.html |
10_dashboard | 前端 SPA, 模块化展示 |
五、接入新模块 (示例: Matrix)
# 10_dashboard/plugins/matrix.py
from plugins.base import DashboardPlugin
class MatrixDashboardPlugin(DashboardPlugin):
name = "matrix"
label = "矩阵养号"
order = 2
def get_summary(self) -> dict:
# 读取 matrix.db 返回统计数据
...
def is_available(self) -> bool:
return Path("~/matrix/data/matrix.db").exists()
然后在 app.py 的 _register_plugins() 中添加 MatrixDashboardPlugin 即可。
六、启动方式
# 方式 1: 通过 AVE 入口 (推荐)
cd 09_ave/scripts && python main.py dashboard
# 方式 2: 独立启动
cd 10_dashboard && python run.py
# 方式 3: uvicorn (开发模式)
cd 10_dashboard && uvicorn app:app --reload --port 9988
七、迁移要点 (Phase 1)
- ✅ 目录搬移:
dashboard/→10_dashboard/ - ✅ Import 路径: app.py 通过
../09_ave/scripts/引用 AVE 模块 - ✅ 插件框架: base.py + ave.py 实现
- ✅ main.py 入口: dashboard 命令指向新路径
- ✅ 前端兼容: 旧 API 路径保持不变
- ⬜ 多机同步: 通过坚果云 / Gitee 同步 10_dashboard/