一个本地资讯站长的半年收录观察
平时我管一个本地资讯站,真名不重要,就叫它“日报编辑部”吧。去年春天开始做新闻收录这个事,每天稳定发稿30篇左右,半年过去,百度新闻源一篇没进。Google那边我之前没指望,但顺手提交了NewsArticle结构化数据之后,竟然冒出来几条收录。这让我觉得,收录规则根本不是看内容质量,而是看你的站点长没长一张“编辑部该有的脸”。
先说两个平台的差别。百度新闻源到今天基本是申请制,需要营业执照和互联网新闻信息服务许可,个人站和地方小媒体根本够不到门槛。即使靠关系进了,也必须“首发+原创”,文章里不能有“本网记者”以外的署名,图片必须带拍摄时间。我在后台观察了一周,baiduspider抓首页特别勤,一天大约七八十次,文章页却三天才来一回,说明简单的新闻发布在百度那里还不如一个更新频繁的论坛帖子。Google News那边完全是另一个极端,它允许你通过 Publisher Center 自行提交站点,前提是内容有清晰作者、发布时间和稳定URL。但实际审查起来也很迷:我拿一篇本地停水通知去测试,15分钟就进了;拿一篇自采的菜市场物价调查,整整48小时没消息,最后发现文章里出现“特价”“清仓”这种词,被归类成商业内容了。
所以我后来有个不一定对的观点:新闻收录系统看起来是在筛选新闻,实际上是在筛选“可信的新闻容器”。Google 喜欢实体机构的联系方式、关于页、条款和固定作者页,百度则喜欢持证机构和千篇一律的摘要模板。两套系统都在用成本最低的方法证明你是媒体,可这种方法恰恰把报道现场的时间成本抹掉了。比如真正在现场的人用手机传回一张图一段话,但站点没有“新闻单位资质”,引擎连索引都不会给你;而各网站用企业通稿拼出来的页面,却因为更新规律拿满了抓取配额。这种对比挺荒诞的。
如果你也刚好遇到这些问题,我提供几个能查证的步骤。第一个,不要先提交新闻源,先检查sitemap里是不是还在用老的时间函数,很多CMS默认生成 daily 的优先级,所有文章都是0.5,这种等于没标注。我改成按文章评论数和更新频率动态算 priority 后,两周内百度抓取文章页的比例从不到10%升到了26%,不算多,但变化是实打实的。第二个,检查URL是否大小写敏感和带参数。我之前用的伪静态规则没把年份和月份放进去,导致的页面有三个不同URL指向同一篇内容,百度站长平台直接判定重复,GSC也有 Indexed but duplicated 的提示。这个坑在追踪新闻事件时特别恶心。第三个,要保留文章的可验证修改时间。我在内容里加了一个副文本“最后更新自本文发出后第6次现场确认”,编辑每次补采访都会更新时间戳,但保留初次发布时间。两个时间都放在NewsArticle里,后来Google收录的命中率提高了不少,百度新闻源的收录依然为零,但我确定至少不是时间戳的锅。
最后说点心态层面的。新闻收录,尤其是那些封闭的新闻源,只是一九八几年建立的代理模式:发行商把内容授权给商店,商店决定摆哪一排。搜索引擎承担的角色不是帮你分发,而是替读者预判可信度。可预判标准往往跟内容实质没多大关系。所以应对方式不是去假装符合那些标准,而是自己保留一份可展示原始记录的时间线,只要URL没死,时间没改,被漏掉的文章可以手动放给读者去看。我会在每周五把没被收录的“遗珠”做成一个 GitHub Gist 链接,页面底端还会放一个基于TXT的邮件订阅入口,这是另一个外人不知道的分发渠道,效果出奇好,很多同行就是从那份列表里开始订阅我的。这套办法听起来不像 SEO 教程,但比迎合算法踏实得多。
以上。如果你正好在做地方新闻或者垂直资讯,欢迎拿这些步骤去你的服务器上验证,然后回来骂我,因为不同层级站点的日志表现差距很大,我不认为自己这个观察能放之四海而皆准。