披露:本页含联盟推广链接。你通过本页链接注册 Apify 并付费,我们可能获得佣金——不影响你支付的价格,也不改变我们如实记录的实测数据。 我们如何实测 →
网页内容抓取:先拿可审计正文,再接知识库或内容巡检
用 Apify Website Content Crawler 抓取你有权处理的网页正文、标题、canonical 与 HTTP 状态码。本站实测自有页面 1 条、22 秒,运行页用量 $0.0100;附可核验样本、Run ID 与中文输入模板。
Actor 本身免费 · 本站自有页面实测 22 秒 · 输出正文 + metadata + 状态码
- 推荐工具
- apify/website-content-crawler
- 使用人数
- 143,619 人在用
- 评分
- 暂未显示公开评分
- 单价
- Actor 本身免费,按平台用量(计算资源)计费
- $5 免费额度
- 足够多次小规模试跑(注册即送,不绑卡)
数据采集于 2026-07-30,以 Apify 实时页面为准。
抓到的数据长这样
[
{
"url": "https://apiactors.com/methodology/",
"crawl": {
"loadedUrl": "https://apiactors.com/methodology/",
"httpStatusCode": 200,
"depth": 0,
"contentType": "text/html; charset=utf-8"
},
"metadata": {
"canonicalUrl": "https://apiactors.com/methodology/",
"title": "我们如何实测:账户、跑量、扣费凭证与更新机制 | ApiActors",
"description": "ApiActors 的实测方法论:自有真实账户实际运行、输出样本、费用记录、截图规范与价格季度复核机制。",
"languageCode": "zh-CN"
},
"text": "我们如何实测:账户、跑量、扣费凭证与更新机制 | ApiActors\n我们如何实测:方法、凭证与更新机制\n原则:没实测的内容不发布\n本站每一个任务页,在发布前都必须完成一次真实运行。做不到的页面会显示\"待实测\",而不是用想象补齐。\n实测流程\n真实账户:所有运行都在我们自有的 Apify Free 套餐账户上执行,使用账户每月平台额度真实跑任务,不是截图拼贴。\n真实运行:每个任务页对应至少一次完整的 Actor 运行,运行 ID 在页面的\"实测记录\"卡片中公开,可对账。\n输出样本:页面展示的样本 JSON 来自对应 Run ID(仅展示前两条的关键字段,长数组与内联图片数据会折叠)。涉及个人信息的标识与主页链接会做必要脱敏。\n费用口径:实测卡会区分运行页事件费与最低结算规则;没有最终账单证据时,不把事件费写成“最终扣费”。\n截图规范:控制台截图保持官方界面原样,只叠加中文标注层(箭头/序号);裁除或遮盖账户标识;标注拍摄日期。\n数据新鲜度\nActor 的价格、用户数、评分来自 Apify 公开 API 的定期快照(当前快照:2026-07-01),每月自动刷新一次,页面脚注展示数据日期。\n人民币换算按 1 USD ≈ 7.2 CNY(2026-07-09)月度更新,仅供直觉参考,结算以 Apify 实际账单为准。\nApify 调价、Actor 迁移计费模型的情况真实存在(我们记录过同一 Actor 四年换三种计费模型),发现数据漂移请邮件告知,我们优先修正。\n收入与独立性\n本站通过 Apify 联盟计划获得佣金:你经本站链接注册并付费,Apify 会把一部分收入分给我们,你的价格不变。佣金不影响结论——每个页面都会写清工具的短板与更便宜的替代方案;长期看,只有推荐真的好用,这个站才活得下去。\n本站为独立第三方,与 Apify 官方无隶属关系;\"Apify\" 为 Apify Technologies s.r.o. 的商标,本站仅作纯文本引用。\n纠错\n发现任何数据过期、样本失真、结论错误:[email protected],我们通常 72 小时内处理。"
}
]| 字段 | 含义 | 说明 |
|---|---|---|
| url | 提交的起始 URL | |
| crawl | 抓取回执 | 含最终加载地址、HTTP 状态码、深度与内容类型 |
| metadata | 页面元数据 | 含 canonical、标题、描述和语言 |
| text | 提取的可读正文 | 示例来自本站自有页面,未展示第三方完整正文 |
我们跑过了:这次扣了多少
真实实测记录(非估算)
✓ 实测 · 2026-07-30 · −$0.0100- 实测日期
- 2026-07-30
- 抓取条数
- 1 条
- 本次运行页用量
- −$0.0100≈¥0.072
- 折合单条
- $0.00996
Actor 标价为免费;此数是本次自有页面运行实际报告的平台计算资源用量,不应外推为固定“每页价格”。
Run ID nsWQZfItbdAONcM6U · 用时 22s · 运行于我们自有真实账户,与样本元数据绑定
算一算:你的量要花多少钱
该 Actor 本身免费,费用为 Apify 平台用量(按运行消耗的计算资源计费),跑小量任务时通常远低于按条计费的同类 Actor——实测费用见上方实测记录。
中文上手:3 步跑通
- 1
先划定你有权处理的 URL 范围
这个任务适合自有站点、客户明确授权的站点,或符合对方条款的公开页面。先列出需要的起始 URL,不要把整个域名、登录后内容或没有授权的客户内容直接扔进去。采集前确认页面用途:内容巡检、迁移验收、知识库更新,还是搜索质量检查。
- 2
从单页、零深度开始建立成本和输出基线
进入 Website Content Crawler 后点 Try for free,先用一个你拥有的页面:
{ "startUrls": [{ "url": "https://你的站点/" }], "maxCrawlDepth": 0, "maxCrawlPages": 10, "proxyConfiguration": { "useApifyProxy": true } }maxCrawlDepth: 0只抓起始页;maxCrawlPages是总量保险栓。确认正文、标题与状态码都符合预期后,再逐步增加深度或页面上限。 - 3
按“正文 + 证据字段”导出,而不是只拷一段文本
运行完成后导出 JSON/CSV。知识库或检索用途保留
text,但也保留canonicalUrl、httpStatusCode和抓取时间:这样能识别重复页面、错误页和已迁移 URL。本站实测自有方法论页面 1 条,22 秒,运行页报告用量约 $0.0100;它是本次运行记录,不是固定单价承诺。
让它每天自己跑:定时采集与监控
内容更新不是每天全站重抓。把 已授权的关键 URL 清单设成每周或每月 Schedule,导出后比较 text、canonicalUrl 与状态码:正文变了再进入人工审核或知识库更新;状态码从 200 变为 404/301 时,优先处理链接与重定向。这样成本和变更都可控。
先读再跑:限制与合规
- 只处理公开且你有权处理的内容;不采集登录页、私密资料、付费墙后的内容,也不把工具当成绕过访问控制的方式。
- 抓到正文不等于获得再发布权。把第三方内容用于检索、摘要、归档前,仍要遵守来源条款、版权和数据处理约定。
- JavaScript 渲染、站点响应速度、重试和深度都会影响平台用量;先小样本跑通,再扩大范围。
- 页面样本使用本站自有 URL,并只展示抓取质量相关字段,避免把第三方全文当作“示例数据”公开。
别的选择也摆上来:同类 Actor 横评
| Actor / 工具 | 使用人数 | 价格 | 一句话判定 |
|---|---|---|---|
| Website Content Crawler(Apify 官方)本页主推 apify/website-content-crawler | 143,618 | Actor 免费,按平台计算资源用量 | 要正文、metadata 和站点内抓取回执,并且愿意先小样本控制范围时,用它。 |
| Google Search Scraper(Apify 官方) apify/google-search-scraper | 145,584 | $0.0045/结果页 + 最低结算 | 目标是先发现 SERP 中的 URL、排名和摘要,而不是读取指定网页正文时,用它。 |
| 手工导出 CMS / 静态构建产物 | — | 取决于现有系统 | 只处理自有 CMS 且可直接导出时,优先用原始内容源;它比再次抓取更完整、更容易保留作者和发布时间。 |
上手前最后几个问题
它能把网页直接变成 Markdown 吗?
它会输出可读正文和页面元数据,适合作为后续 Markdown 清洗或分块的输入。是否直接入库取决于你的格式规范;建议先保留原 URL、canonical 和抓取时间,避免以后无法追溯来源。
为什么“Actor 免费”,实测仍然有费用?
Apify 有两层计费:Actor 可以不按结果条数收费,但运行仍会使用平台计算资源。本页的约 $0.0100 是一次单页自有站点实测的运行页用量;深度、页面量和渲染情况不同,不能当固定每页报价。
可以用它批量建立 RAG 知识库吗?
可以作为你有权处理的来源的提取层,但它不替你解决授权、去重、版本管理、敏感信息和引用追溯。先用小 URL 清单验证正文质量,再把 canonicalUrl 和抓取时间一起写入你的入库流程。
应该把抓取深度设多大?
从 0 开始,只确认起始页的输出和成本;需要同一栏目下的文章时再升到 1,并始终设置 maxCrawlPages。没有上限的深爬既难控成本,也容易抓入导航、标签和重复页。
样本、扣费凭证、Run ID 你都看过了,轮到你自己的数据。
注册即送 $5/月额度,不绑卡,跑完再决定要不要付费。
免费跑我自己的第一批 →本页含推广链接;价格与目录数据采集于 2026-07-30,以 Apify 实时页面为准。