Agent 联网访问阶梯与合规研究栈
“爬全网”是一个很诱人的说法,也最容易把完全不同的事情混在一起。 源素材把 Agent-Reach、Scrapling、Browser-use、Claude for Chrome、Web-access 放在同一套工具链里,并总结成“从轻到重,够用就停”。这个方向本身很有价值,但其中“破反爬”“接管日常 Chrome”“把课程后台文档和视频扒下来”这些描述,如果直接当教程发布,会同时忽略平台条款、版
别再说“Agent 能爬全网”:真正可靠的联网自动化,是从最轻访问一路升级到浏览器动作
“爬全网”是一个很诱人的说法,也最容易把完全不同的事情混在一起。
源素材把 Agent-Reach、Scrapling、Browser-use、Claude for Chrome、Web-access 放在同一套工具链里,并总结成“从轻到重,够用就停”。这个方向本身很有价值,但其中“破反爬”“接管日常 Chrome”“把课程后台文档和视频扒下来”这些描述,如果直接当教程发布,会同时忽略平台条款、版权、登录态、Cookie、隐私和提示注入风险。
真正值得沉淀的是一个访问阶梯。
Level 1:Search / 官方 API
这是最优先的入口。
如果公开搜索、RSS、官方 API、导出功能能回答问题,就不应该先开浏览器。
优势是:
- 权限小;
- 结构稳定;
- 可审计;
- 更少把 Cookie 和登录状态暴露给 Agent;
- 更容易遵守平台规则。
Agent-Reach 的意义更接近“把多个渠道的读取方式封成统一入口”,而不是拿到一张“全网访问许可证”。它当前仍活跃,MIT License,而且 release 历史里已经出现过渠道增删和 Windows 修复,这本身说明:平台能力会漂移。
Level 2:HTTP Fetch / 结构化抓取
当 API 不够,才进入网页抓取。
Scrapling 的能力确实强:静态请求、浏览器渲染、自适应选择器、爬取框架都能做;但它自己的 README 同样明确提醒使用者遵守本地法律、网站条款和 robots.txt。
这说明一个很重要的编辑原则:
> 工具支持 stealth,不等于你获得规避规则的权利。
“能绕 Cloudflare”不能被 alphahole 翻译成“教你绕平台风控”。
Level 3:Authenticated Read
如果内容确实属于用户自己有权访问的数据,例如:
- 自己的后台;
- 自己购买且允许导出的资料;
- 企业内部系统;
- 自己的 CRM / Docs / Dashboard;
- 公开搜索/社媒检索:优先 Search/API 或 Agent-Reach;
- 普通网页结构化:HTTP fetch / Scrapling;
- JS 页面但只需读取:浏览器读模式;
- 登录后台:明确授权后 authenticated read;
- 必须点击/提交:最后才上 browser action。
才进入登录态读取。
这时要新增四个 Gate:
Identity / Data Rights / Cookie Scope / Export Permission
“浏览器里已经登录”不是权限证明。
Level 4:Browser Action
这是最重的一层。
Browser-use、Claude for Chrome 这类能力不仅能读,还能点、填、提交。风险也从“读错”升级成“做错”。
Anthropic 对 Claude for Chrome 的官方说明直接把 prompt injection 列为浏览器 Agent 的核心风险:网页里的恶意隐藏指令可能诱导 Agent 泄露数据、删除文件或执行非预期操作。官方还会屏蔽金融、交易、成人、加密交易所等高风险站点,并对某些发布/购买动作要求确认。
所以 Browser Action 必须再加:
Prompt Injection Gate / Reversible Action / Human Confirmation / Domain Allowlist / Data Boundary / Audit Log
“课程网站全流程扒下来”为什么不能原样保留
这里不是技术问题,而是权利问题。
如果课程允许下载、用户拥有许可,当然可以做个人知识整理;如果平台明确禁止批量抓取或内容受版权保护,就不能把“技术上能拿到”变成“可复制 SOP”。
安全版应该写成:
有权访问 → 有权导出/处理 → 最小范围读取 → 记录来源 → 不再分发未经授权内容。
五个工具应该怎么选
不要装全家桶。
真正的优化目标不是“成功率最高”,而是:
在完成任务的前提下,用最低权限、最少状态、最小攻击面。
Research Access Contract
以后 alphahole 研究工具统一记录:
Target / Right-to-access / Preferred API / Authentication / Data Sensitivity / Action Level / Prompt Injection Risk / Rate Limit / ToS / Audit / Fallback。
这套合同比“2026 五大爬虫 Skill”更耐用。
最后
一个 Agent 能读到某个页面,并不意味着:
- 你有权抓;
- 你有权保存;
- 你有权二次分发;
- 你有权让它自动提交动作。
真正成熟的联网 Agent,不是“能爬全网”。
而是知道什么时候不该开浏览器。