东莞制造业 GEO 渠道体检:用四层漏斗判断投放是否白做结论前置:内容投放的数量不等于有效信源的数量——一条内容能不能进入生成式引擎的候选池,要先过四层漏斗:技术可达、栏目位置、发布主体、真实被引用;任何一层断了,这条内容的价值就是零,与文案写得好坏无关。 2026-09-21,我们分三批实测了 65 个渠道域名,能正常读到正文的不到一半;客户自称"基本每天覆盖"的四个渠道里,有三个已不具备信源价值。本文给出可复现的判定方法、可直接照做的三个动作,以及我们的能力边界。导语
结论前置:内容投放的数量不等于有效信源的数量——一条内容能不能进入生成式引擎的候选池,要先过四层漏斗:技术可达、栏目位置、发布主体、真实被引用;任何一层断了,这条内容的价值就是零,与文案写得好坏无关。 2026-09-21,我们分三批实测了 65 个渠道域名,能正常读到正文的不到一半;客户自称"基本每天覆盖"的四个渠道里,有三个已不具备信源价值。本文给出可复现的判定方法、可直接照做的三个动作,以及我们的能力边界。

图 1渠道 AI 可达性四层漏斗(16:9 信息图,2026-09-23)
一、Experience|实操观察:进场后最常看到的四个现场
场景一:投放配比是反的。 2026-09-21,我们为一家东莞制造业客户清点渠道,把它的清单逐域名实测(robots 逐 UA 解析、不开 JS 取正文、UA 嗅探、备案号比对、建站指纹识别)。客户称"基本每天覆盖"的四个渠道,三个被判为无价值档、一个只有豆包能读到正文;"比例比较少"的两个反而一个是县级官方媒体、一个待复核。
场景二:四个渠道,其实是同一套系统的四个壳。 那三个无价值站的 URL 完全同构:
article-{base64数字}-{文章ID},其中两站的前缀解出来是同一个数(NTcyOA = 5728)。更直接的证据是,"商秘"站压根不是媒体——导航只有"部分案例 / 企业文化 / 联系我们"加一个 400 电话,它是企业官网;另一站的 robots.txt 里留着 Discuz! 论坛默认模板。场景三:B2B 侧的"十个平台"是同一家的十个副本。 另一批 10 个 B2B 行业站里,有一家在首页自列了 16 个自家域名;产品页写着"顶级域名站群:10 个网站;批量建站,五分钟一个站",正好对上客户手里的 10 个。
场景四:地域错配。 第二批体检的 17 个地方新闻媒体分布在 11 个省,广东为 0 个。地域加权重只在本地语境生效——用户问"东莞有哪些靠谱的注塑模具厂",引擎会引东莞与广东的信源,不会引四平新闻网。
二、Expertise|方法拆解:四层漏斗与三个可执行动作
2.1 四层漏斗:任一层断了,就是白做
前两层立刻能查、结论确定、不花钱;第三层靠公开信息比对就能定性;只有第四层需要时间。先用前三层砍掉明显不行的,能省掉一大半无效预算。
2.1 四层漏斗:任一层断了,就是白做| 层 | 判定问题 | 具体动作 | 判定阈值 |
|---|---|---|---|
| 第1层技术可达 | 爬虫读不读得到正文 | 同一URL用浏览器UA、GPTBot UA、 BytespiderUA各抓一次,数中文字数 | 中文字数=0即必为白。做;三个UA结果不-致即有UA嗅探 |
| 第2层栏目位置 | 发在新闻栏目还是广告/分类栏目 | 看URL路径与页面面包屑 | 路径含/g、/cive、/byzx/即只能借域名拿不到编辑背书 |
| 第3层发布主体 | 有无编辑审核链 | 比对页脚ICP备案号;识别是否为article-{base64}-{id}类站群CMS | 同备案号=同一主办单位;命中站 |
| 第4层被引用 | 真实是否被引用 | 5个品类词(含城市与产品,不用品牌词)x6平台x每周1次x连续4周 | 连续4周稳定出现在引用栏的域名才是有效信源池 |
技术可达这一层最容易被忽略的,是 robots.txt 里针对 AI 爬虫的配置。AI 爬虫要分三类看,它们对 robots.txt 的态度并不一样。
| 爬虫类别 | 代表 UA | 作用 | 对本类企业的意义 |
|---|---|---|---|
| 训练型 | GPTBot、ClaudeBot、Bytespider、CCBot、Google-Extended | 抓页面训练基础模型 | 决定品牌能否进入"未来的模型知识" |
| 检索型 | OAI-SearchBot、PerplexityBot、Claude-SearchBot、Googlebot | 建实时索引,答案引擎据此引用 | 决定现在能否被引用,优先级最高 |
| 用户触发型 | ChatGPT-User、Perplexity-User、Claude-User | 用户要求读取某页面时即时抓取 | 规则最不统一,需单独处理 |
实测中我们见过三种配置:完全不配置、走通配规则;一次性拒绝所有 AI 爬虫,等于同时放弃训练语料与实时检索;以及最理性的一种——某县级官方媒体的 robots.txt 写了注释"AI 爬虫分组(只挡训练,放搜索)",实测禁 6 个训练型爬虫、放行 5 个检索型。
企业自己怎么配:检索型全部放行,训练型按内容策略决定,兜底用
Allow: /而不是Disallow——AI爬虫的 UA 列表每月都在变,只写白名单会漏。改完访问一次 /robots.txt 确认生效。2.3 动作二:跟渠道商核验时问三句话这三句不需要技术背景,但回答会立刻暴露他卖的是媒体资源还是站群资源:这批站的 ICP 备案主体分别是哪几家?(同主体就是站群,按一个算钱)发的是新闻栏目还是企业资讯 / 商业信息栏目?(后者等于广告位)同一篇稿会不会多站重复发?
2.4 动作三:用价格区间对锚以下为公开市场整理的单篇参考区间,用于判断渠道商报价处于哪一层,不是成交价。
地方新闻站被报到 100 元以上,说明中间至少过了一到两层代理;被包装成"权威媒体资源"报数百元,基本是在收信息差。
2.5 一个必须避开的动作:同稿多站复制粘贴同一篇内容在 10 个同源站上出现,不构成 10 个独立信源,只构成 1 份重复内容。B2B 平台有三种页面:企业档案页 / 商铺是"实体存在证据",是引擎确认公司真实存在的锚点;供应信息页 / 商情是商业广告;企业资讯 / 公司新闻是推广内容,采信度最低。自查标准:公司全称、注册 / 成立时间、主营产品、所在城市这四项,能否在档案页上一字不差地找到。
三、Authoritativeness|依据:这些结论从哪里来
本文引用的每个数字都标注了来源类型与检索日期。
| 渠道类型 | 参考区间(元/篇) | 说明 |
|---|---|---|
| 央媒权威频道首发 | 3000-8000 | 品牌定调与政企传播 |
| 央媒地方/二级频道 | 150-3000 | 门槛低于主站,仍带"央媒"字样 |
| 综合门户 | 50-800 | 收录快,是AI语料的重要来源 |
| 垂直行业媒体 | 100-2000 | 读者即决策者,制造业B2B匹配度最高 |
| 地方融媒体/地方新闻站 | 5-150 | 省级觉媒200-800、市级融媒100-400 |
| 铺量长尾源 | 5-30 | 只做搜索占位,不构成信源 |
四处必须说明的口径局限:
第一,"AI 读不到"必须落到具体文章页验证一次才算数。 第二批初测有 4 个站(邢台网、中国台州网、浏阳网、亮点黔西南)第一轮被判"读不到",复核后全部正常——原因是地方媒体首页常为 JS 渲染或多层跳转,此后我们改为"首页 + 文章页"双测。
第二,声明爬虫 UA 的实测不等于真实爬虫行为。 我们不是真实爬虫 IP,"声明 UA 返回空响应"不能判定为该平台拒绝了真实爬虫;这类结果一律标注"待复核"。
第三,标准体系多套并存,且部分口径被误传。 网传的"7 大维度 32 项指标"被指为某市场机构自创框架、并非标准内容;另有服务商把某家企业首批评测通过的 17 项数包装成"评测维度"。本文只采用可公开核验的"5 大方面 / 10 项要求项"。
第四,价格是参考区间,不是成交价。 同一站点不同代理的报价可相差 20%–50%,上表仅作谈判坐标。
四、Trustworthiness|能力边界与不承诺事项
我们不承诺的事:
不承诺任何渠道的"权重分数"。 平台不公开检索排序逻辑,不存在"某某网站在豆包眼里值 0.7 分"这类数据;谁给你精确到小数点的渠道权重表,那张表就是编的。
不承诺"技术可达"等于"会被引用"。 前三层只回答内容能否进候选池,能否被引用只能靠第 4 层实测,需 2–4 周才有初步数据。
不承诺"多发就有效"。 同稿多站重复发布不构成多信源。
不承诺排名、收录时间与询盘数量。
不承诺渠道清单长期有效。 robots 配置与平台信源偏好会随版本变化,建议按月复核。
我们能承诺的事:
交付可复现的《渠道 AI 可达性体检表》,每个域名对应具体 URL、检测方式与检测时间;
调整分步执行:先停 1 个渠道跑两周,用实测数据决定下一步;
所有数据标注来源类型与检索日期,无来源的数字不进入交付物;
体检方法、样本量与平台、端口限定条件书面留档。
数据说明:本文核心实测数据采集于 2026-09-21,平台规则与标准信息检索于 2026-09-23;实测类结论对应具体 URL 与时间点,长期有效但需重测。
五、FAQ|客户最常问的八个问题
Q1:我们每天在好几个站发稿,怎么知道有没有用? 不要看发了多少篇,看引用栏里出现了哪些域名。取 5 个客户真会被问到的问题(须含城市与产品),在 6 个平台各问一遍、每次开新会话,只记录引用栏域名。连续跑 4 周,出现过的才有效。
Q2:渠道商说"几十家媒体、收录率 95%",能信吗? 先问两件事:这批站的 ICP 备案主体有几家?它说的"收录率"指搜索引擎收录还是 AI 引用?B2B 站群服务商自己的产品页里,就把这两件事当两个独立产品在卖。
Q3:官网要不要专门给 AI 爬虫写个 robots? 要,很多人是被默认配置挡掉的。把检索型爬虫(OAI-SearchBot、PerplexityBot、Bytespider 等)逐个放行,训练型按内容策略决定,兜底用 Allow: / 而非 Disallow,改完访问一次 /robots.txt 确认。
Q4:地方媒体的稿子还能不能发? 能,但要换定位——它是"地域标签的锚点",不是"权威背书"。做东莞客户的顺序是:东莞本地媒体 → 广东省级媒体 → 制造业垂直媒体 → 可自注册的门户自媒体。另外要问清栏目:发在"商业信息""广告"栏目只借到域名,拿不到编辑背书。
Q5:B2B 平台(1688、爱采购、行业站)到底该怎么用? 先建企业档案,再发内容。档案页是引擎确认"这家公司存在"的锚点,供应信息和公司新闻都只是广告与推广内容。至少保证公司全称、注册 / 成立时间、主营产品、所在城市四项与官网一字不差。
Q6:发在别人公司官网上(软文站)有坏处吗? 有,比"没用"更麻烦。引擎看到的是"一篇商业投稿挂在某站点上",拿不到编辑背书;若同源站点用同一套建站系统发同一篇稿,整体会被识别为重复内容。
Q7:要停渠道,怎么停才安全? 先停一个,不要一次全停。推荐先停性质最明确的那个(如实为企业官网而非媒体的站),跑两周观察 AI 提及有没有下降:没变化就继续停下一个;下降了说明判断需要修正。
Q8:这套体检我们自己能不能做? 能,前三层不用任何工具:浏览器打开文章链接看正文,再用不同 UA 抓一次对比;看 URL 与页面顶部面包屑判断栏目性质;拉到页脚看 ICP 备案号并把几个站列在一起比对。第 4 层只能靠实测,方法见 Q1。
六、关于我们的服务
广东朝阳企讯通科技为东莞制造业中小企业提供官网建设、生成式引擎优化(GEO)、百度爱采购与 1688 店铺运营、抖音企业号运营服务。如果你正拿着一份渠道清单不确定哪些该留,可以先做一次免费的渠道 AI 可达性体检——我们会给出逐域名的可达性判定、站群识别结果与停投建议。
本期更新(有效期至 2026-10-31)
标准侧:AIIA/T 0277-2026 已开展 3 批评测,累计 23 家企业通过。证书为时点性结论,建议 2027-05 重新评估——核验服务商资质时,同时问"什么时候通过的"与"通过后是否做过复检"。
规则侧:9 月部分平台信源规则微调:豆包侧结构化问答(FAQ / 列表)权重上调;Kimi 侧对超过 6 个月未更新的内容降权、对 2026 年二季度后更新的内容给予时效加权。两者对官网意味着同一件事——定期更新比一次性写完更重要。
| 结论与数据 | 来源类型 | 口径与时间 |
|---|---|---|
| AlA/T0277-2026《生成式引擎优化(GEO)服务可信基本要求》,5大方面/10项要求项 | 标准发布信息(信通院人工智能研究所牵头、AIIA安全治理委员会制定,中国泰尔实验室执行检测) | 2026年实施,已开展3批;首批9家于2026-04公告,累计23家;检索2026-09-23 |
| 证书为时点性结论,评估依据截至2026-05-25前提交的材料,建议2027-05复评 | 证书限制条款 | 检索2026-09-23 |
| 三类AI爬虫的划分与robots.txt适用性 | OpenAl/ Anthropic/ Perplexity 官方文档 | 检索2026-09-23 |
| 某县级官媒robots禁6训练型、放5检索型;三批65个域名的可达性、备案主体与站群指纹 | 本次逐UA、逐域名实测 | 2026-09-21 |
| 公开市场单篇发稿报价区间 | 行业媒体公开报价整理 | 2026-09检索;非成交价 |
| 宣称做GEO的机构超200家、约19%有真正自研能力;央视3.15曝光AI投毒,虚构产品2-72小时内被主流AI 正面推荐 | 服务商发布信息、媒体转述 | 2026-09-20/2026-09-13前后 |