面向中国市场的本地商户 GEO(Generative Engine Optimization,生成式引擎优化)收录与推荐力审计工具。 基于豆包/字节官方输出的「本地商户收录与推荐规则」口径,对文心·百度、豆包·字节、腾讯元宝、通义千问·阿里、DeepSeek、Kimi 六大国内 AI 平台,检索商户公开信息并按规则评分,输出扁平化、可离线打开的 HTML 报告。
把一家本地商户(餐饮、住宿、美业、家装、零售等)的信息,让它被国内 AI Agent 在用户提问时「搜得到、信得过、排得前、主动推」。
各平台内部权重是黑盒,本工具不是厂商排名保证,而是「基于公开免费信源的规则对齐度诊断」——明确告诉商户:哪条信息没做好、做错、缺什么资质,以及先改哪条投入产出比最高。
- 规则驱动,采用豆包官方口径:三级数据源 + 否决/收录/加权 + 七品类专项 + 六平台差异化权重 + 六条输出原则,全部结构化于
rules/local_merchant_rules.json。 - 三级数据源(按采信优先级):
- Tier1 官方监管(100% 采信,多数禁自动化抓取 → 产出人工核验清单)
- Tier2 第三方聚合(天眼查 / 企查查 / 大众点评 / 地图 POI / 百度)
- Tier3 辅助参考(官网 / 公众号 / 抖音 / 行业协会 / 用户评价)
- 判定流水线(严格顺序):
一票否决 V1–V6 → 收录资格 I1–I4 → 四维加权 D1–D4 → 综合总分 → 分平台得分 → 存疑从严 P4 扣分。总分在主卡最前,分平台得分其后。 - 零外部依赖核心路径:标准库
urllib+html.parser即可跑通;--deep才尝试 Playwright 真实浏览器补抓(隔离安装,失败自动降级)。 - 扁平化自包含 HTML 报告:政务公文式抬头 + 总分主卡 + 判定链步骤条 + 四维条形 + 六平台矩阵 + 短板清单 + 改进建议 + 人工核验清单 + 原则与免责。内联 CSS、零外部资源,可离线打开。
- 交互友好:直接运行即逐项询问商户名/主体/行业/城市/官网/落盘位置/深度模式;自定义落盘目录记入
memory/memory.md下次默认沿用。
- Python ≥ 3.10。若本机不满足,脚本会明确提示并交互式征求同意后,自动下载官方 embeddable Python 安装到
runtime/python(不修改系统环境);拒绝则退出报错。 - 核心路径无需任何第三方包。
--deep模式需联网安装约 150MB Chromium(隔离在scripts/.venv)。
python scripts/run.py按提示输入商户招牌名、工商主体、行业、城市、官网地址,选择落盘目录与是否启用深度模式即可。
python scripts/run.py \
--brand "门店招牌名" \
--company "工商登记主体名称" \
--industry "餐饮" \
--city "北京" \
--url "https://官网地址" \
--output "自定义落盘目录" \
--deep \
--yes--yes / 环境变量 GEO_PROF_ASSUME_YES=1:自动同意安装与环境询问,用于无人值守。
| 参数 | 说明 |
|---|---|
--brand |
商户招牌 / 对外名称(交互式必填) |
--company |
工商登记主体名称,回车沿用招牌名 |
--industry |
行业 / 品类(如 餐饮 / 美容美发 / 家装),用于品类专项校验 |
--city |
城市,用于本地信源定位 |
--url |
官方网站 URL(强烈建议提供,否则结构维度缺数据) |
--output |
自定义 HTML 落盘目录(记录于 memory/memory.md,下次默认沿用) |
--deep |
启用 Playwright 深度爬取模拟(失败自动降级) |
--yes |
自动同意安装 / 依赖询问 |
判定顺序
- 一票否决
V1 主体状态异常 / V2 核心资质失效 / V3 重大安全责任事故 / V4 严重失信违法 / V5 投诉集中且整改不力 / V6 虚假经营—— 命中即 0 分 / F 级,排除推荐(仅当信号出现在可信来源才升级为 high 置信否决)。 - 收录资格
I1 主体合法存续 / I2 核心资质齐全 / I3 无重大失信违法 / I4 基础信息可交叉验证—— 未全满足则总分封顶 55,标注「尚未具备被推荐的基础资格」。 - 四维加权排序
D1 合规等级(0.35, 最高) / D2 需求精准匹配(0.20) / D3 经营稳定性(0.20) / D4 口碑与投诉表现(0.25)。 - 总分 → 分平台:同一套证据,按各平台信源偏好权重换算六大平台得分。
- 存疑从严 P4:不可自动核验项按项扣分(每项 −8,上限 −25),并输出人工核验清单。
六大平台(分平台差异化权重与生态信源):文心·百度、豆包·字节、腾讯元宝、通义千问·阿里、DeepSeek、Kimi。
六条输出原则:P1 官方最终 / P2 交叉验证 / P3 时效性 / P4 存疑从严 / P5 中立不背书 / P6 可抓取(合规优势若仅以图片或登录后可见形式存在,对 AI 等同于不存在)。
- 公文抬头(商户 / 主体 / 行业 / 城市 / 官网 / 时间)
- 总分主卡(综合总分 + 等级,最醒目)
- 判定链步骤条(否决 → 收录 → 评分 → 分平台)
- 收录资格判定(I1–I4)
- 四维加权评分(D1–D4 子项 + 未核验标注)
- 分平台可见性得分矩阵
- 做得不好的点(按严重度排序)
- 改进方向建议(P0 / P1 / P2)
- 检索执行情况(成功 / 反爬拦截 / 未取得)
- 官方渠道人工核验清单(12 项法定信源直达链接)
- 校验与输出原则 + 免责声明
geo-professer/
├── SKILL.md # Skill 定义(触发条件 / 使用方式 / 规则体系)
├── README.md # 本文件
├── rules/
│ └── local_merchant_rules.json # 核心 IP:豆包口径三级数据源 + 否决/收录/加权 + 六平台 + 品类 + 六原则
├── scripts/
│ ├── run.py # 主编排器(交互采集 → 环境自检 → 检索 → 评分 → 渲染)
│ ├── bootstrap_env.py # 环境自检与可选依赖安装(venv 隔离,Python<3.10 交互征同意)
│ ├── retrieve.py # 三级信源检索 + AI Agent 式爬取模拟(best-effort)
│ ├── score.py # 规则驱动评分引擎(V1–V6→I1–I4→D1–D4→总分→分平台)
│ ├── render.py # 扁平化 HTML 报告渲染(内联 CSS,无外部依赖)
│ ├── playwright_sync.py # 可选深度爬取(Playwright,缺失自动降级)
│ └── .venv/ # 仅 --deep 模式自动生成
├── vendor/
│ └── frontend-design/ # 引用的专业 HTML 设计 skill(Anthropic 官方,Apache-2.0,仅作视觉规范参考)
├── memory/
│ └── memory.md # 用户自定义落盘目录偏好记录
├── output/ # HTML 报告默认落盘处(生成报告不纳入版本库)
└── runtime/
└── python/ # 仅当用户同意且本机无 ≥3.10 时自动安装的内嵌 Python
- 各平台内部权重为黑盒,本报告是「基于公开免费信源的规则对齐度诊断」,不是厂商排名保证。
- 免费信源(尤其百度 / 天眼查 / 企查查 / 大众点评)对自动化请求有反爬与频次限制,单商户单次审计即可,避免高频。
- 被反爬拦截 ≠ 商户有问题:相关项按「存疑从严」原则计低分并进入人工核验清单;核验完成可显著提升总分。
- 多数 Tier1 官方渠道禁止自动化抓取,其结论以人工核验清单形式提供。
- 规则库随平台政策更新需人工维护(见
local_merchant_rules.json的meta.version)。 - 本工具仅做信息聚合与规则诊断,不构成法律、广告合规或经营资质意见。正式合规以主管部门与平台官方认定为准。
- 本 Skill 代码版权归 KeywayTech 所有,按仓库约定使用。
vendor/frontend-design/为 Anthropic 官方 skill,采用 Apache-2.0 许可,仅作为 HTML 视觉规范参考引入,未修改其原始内容。