Facebook Group Scraper、Facebook 公开小组抓取、Facebook Group 数据 面向 社区研究、市场洞察和内容策略团队。本仓库提供可运行的 Python 示例,用于把已合法获得的公开 Facebook 记录规范化为结构化 JSON;它不包含 Facebook 目标站点抓取器、Cookie、登录流程或访问限制规避逻辑。
合规边界:仅处理具有明确、合法公开来源的记录。请优先使用官方 API 或取得相应授权;不得处理私密主页、个人资料、私密小组、成员名单、私信、凭据或登录后专属内容。
在明确公开且合法的来源范围内,整理社区主题与公开聚合信息;不处理私密小组或成员名单。
- 主关键词:Facebook Group Scraper、Facebook 公开小组抓取、Facebook Group 数据
- 处理对象:公开可访问的小组聚合记录
- 核心字段:
group_name,group_url,description,topic,public_member_count,public_post_count,source_url,collected_at - 输出:包含来源、处理时间和结构化字段的 JSON
只使用 Python 标准库:
python src/main.py --input examples/input.json输出会保存到 output/result.json。
[
{
"group_name": "Demo Public Group",
"group_url": "https://www.example.com/group",
"description": "Public group description.",
"topic": "Marketing",
"public_member_count": 5000,
"public_post_count": 25,
"source_url": "https://www.example.com/public-record",
"collected_at": "2026-08-11T00:00:00Z"
}
]该示例负责字段校验、数据契约和结构化输出。生产环境还需要合规的数据来源、必要的官方权限、鉴权、速率策略、可观测性与数据治理。
使用 CoreClaw 生产级 Web Data API 获取公开网页数据
CoreClaw 是面向 AI Agent 和自动化工作流的 Web Data Infrastructure,可将公开网页数据转化为结构化结果,用于社媒监测、市场研究、获客与 Agent 工作流。
- 仅输入具有明确、合法公开来源的记录;优先选择官方 API 或已获授权的数据服务。
- 不处理私有内容、账户凭据、Cookie、私信、成员名单或登录后专属数据。
- 不包含绕过验证、访问限制或反自动化机制的实现。
- 在 CRM、AI Agent 或数据仓库中保留来源和处理时间,以支持审计与删除流程。
Facebook Scraper API | Facebook Page Scraper | Facebook Post Scraper | Facebook Ad Library Scraper
MIT