browser-act/skills (浏览器技能包)
给 AI agent 用的真浏览器自动化技能包:CLI 封装完整浏览器引擎,支持 JS 渲染抓取、三层反爬(指纹伪装/自动验证码/人工远程接管)、多账号并行隔离与登录态复用,并配套 Skill Forge 生成器和 30+ 预构建抓取技能。
仓库:browser-act/skills
热度证据:5,361 star,浏览器技能包专门仓库
五维评分
热度4/5
质量5/5
创新5/5
易用4/5
文档5/5
优秀点拆解
- 两层架构让文档永不陈旧:SKILL.md 只是发现桩,真实指令由 get-skills CLI 按 --skill-version 实时输出并做版本校验,内容与环境状态、动态 Directives 匹配
- 交互范式为 LLM 推理重构:state 返回索引化紧凑文本(比 JSON/HTML 省数倍 token),click 3/input 2 按索引操作免去 XPath 与 DOM 解析,desc 语义记忆让多浏览器按意图匹配而非硬编码 ID
- 三层渐进式反爬 + 人机交接闭环:Environment(指纹/TLS 轮换/代理)吸收绝大多数拦截,Execution(solve-captcha、stealth-extract)自动解,Human(remote-assist 任意设备接管)兜底,升级策略写成决策表
- 确认门控作为 Skill 层会话协议:创建/删除浏览器、Profile 导入、代理变更等敏感操作每次需显式用户批准,prior approvals 不延续,数据本地化承诺(唯一外发=验证码图片)写进 front matter 可审计
- Skill Forge 探索-固化-复用闭环:一次探索生成带参数脚本与 SKILL.md 的可用技能包,交付前经子代理端到端测试,经验笔记机制让运行期把策略失效追加进 memory 供下次读取
可复用的设计模式
- CLI 即文档/运行时内容模式:SKILL.md 保持轻量稳定,指令正文由工具实时输出并做版本校验,配 core→advanced→main 渐进加载控制上下文预算
- 语义记忆字段 + 决策优先级表:用自然语言 desc 描述资源用途、跨会话语义匹配,配『匹配→唯一→询问用户』选择优先级,--desc-append 追加语义累积知识
- 三层升级策略:环境层→执行层→人工层逐级兜底,触发条件与升级路径写成表格,把『自动化解不了怎么办』变成确定性流程
- 生成器 + 经验笔记自学习:探索先验证 API/DOM 路径再固化为脚本包,运行期把策略失效记录追加到 memory 文件,一次性逆向经验沉淀为持久资产
适用场景
抓取需要 JS 渲染或反爬保护的网页内容(WebFetch/curl 的进阶替代,stealth-extract 零配置单命令)多账号并行运营与监控:stealth 固定身份模式,每个账号独立指纹+固定 IP,站点间不可关联(电商多店铺、竞品价格监控)复用本地 Chrome 登录态做自动化:Profile import 快照或 CDP 直连,免重复登录 Gmail/GitHub/Jira 等自动化卡住时人工接管:验证码解不开或风险操作,remote-assist 生成 live URL 让用户从任意设备接手后 agent 无缝继续把某网站的数据提取固化为可复用技能:Skill Forge 探索 API endpoint → 生成 SKILL.md+scripts → 批量执行(LinkedIn 职位、Amazon 商品等 30+ 成品可参考)
边界与注意:stealth 浏览器超 5 个与托管代理需付费、stealth/solve-captcha 等需注册 API Key;solve-captcha 会把验证码图片发送到云端;确认门控效果依赖宿主 agent 对 skill 指令的遵循度;chrome-direct 会占用用户本地 Chrome(全局配额 1 个);依赖 uv + Python 3.12 安装。
完整拆解分析文档
本页为摘要版,完整精读分析(核心机制、逐条优秀点拆解、写作过程)见本地 Markdown 文档:
analysis/community-browser-act.md