先交代下背景,免得有人说我瞎扯。2022 年 3 月到 2023 年底,我在一家做快消的公司管过一段时间的舆情,手下没兵,就我一个半吊子,外加一个每周来两天的实习生。预算批下来 8 万一年,我拿着这笔钱试了三套方案,下面写的全是真实的报价、真实的坑,还有那个让我半夜三点从床上弹起来的告警。
先说个反常识的结论
市面上所有卖舆情监控的,卖的都是「数据量」,不是「判断」。你去看他们的介绍页,一定是「日均抓取 5000 万条」「覆盖 30 万个站点」「支持 12 种语言情感分析」。但没人在合同里写误报率是多少、告警准确率多少。我后来自己拿 Excel 统计过——某家头部 SaaS 推给我的告警,我点开之后真正需要我们品牌出手处理的,不到 15%。剩下那 85% 是什么?是竞品的新闻稿里顺带提了我们一句名字,是 2019 年的旧帖子被搜索引擎重新收录了一次,是某个同名的小公司在别的省份被人投诉。你花几万块买的不是雷达,是一个一直在响的烟雾报警器,炒菜它也响。
三套方案的真实成本,我摊开说
方案 A:买 SaaS。 我前后谈过四家,报个真数(都是 2022 年的报价):新浪舆情通,标准版一年 3.8 万,高级版 7 万往上;清博智能基础套餐 2.6 万,但微博历史数据要另外加钱;蚁坊软件的鹰击系统,政企版给我报了 12 万,我砍到 9.5 万没谈成;识微科技便宜些,1.8 万起步。有个共同点——销售演示的时候,素材清一色是特斯拉、蜜雪冰城、东方甄选这种量级的品牌,数据确实全。但你换成自己那个年销三亿的品牌再看,一天也就抓出来四五百条有效信息,因为你压根没那么大名气。花钱买的是心里踏实,不是数据密度。
方案 B:自建。 这个我是真干过,不是纸上谈兵。两台阿里云 4 核 8G(一台跑爬虫、一台跑 ES),外加一块 500G 的 ESSD 云盘,一个月固定支出 1400 块左右。技术栈说出来不复杂:Playwright 抓微博和知乎,Scrapy 抓新闻站和贴吧,中间用 Kafka 顶着,最后落 Elasticsearch,前面挂 Kibana 做看板。理论上一天能跑五十万条。实际上呢——微博 2022 年之后未登录基本抓不动,你得养几十个 cookie,一周死一批,死一批补一批;知乎的反爬更狠,我三个月后基本放弃了。真正稳定拿到的只有新闻站(RSS 加列表页)和黑猫投诉,这俩加起来一天三万条左右,够用了。隐性成本是我每周得花 6 到 8 小时维护,折算下来一个月也是两三千块的工钱。
方案 C:人工。 我一开始最瞧不上这个,觉得土。后来发现,真正帮我兜住事的全是人工渠道,而且是仨:黑猫投诉 App 的推送(免费、实时,这个强烈建议所有做品牌的都装上)、微博搜索栏手动刷(搜品牌词,切到「实时」标签页,早中晚各刷 10 分钟)、还有 400 客服的日报表。三样加起来零成本,但覆盖了 90% 真正需要动作的事件。逻辑特别朴素——真正会发酵的事,一定会有用户先跑去投诉、先去微博骂、先打客服电话。全网扫描反而是最后才知道的那一个。
那个凌晨三点的告警
2023 年 4 月的一个周二,凌晨 3 点 17 分,钉钉把我炸醒了。告警内容是「负面情感指数突破阈值,涉及品牌关键词 47 条」。我从床上滚起来打开电脑一看,是某地一个县级市场监管局发布的一批食品抽检通告,里面有一条不合格产品,厂家名字里带了跟我们相同的两个字。就俩字。那条通告被十几个地方号转载,算法把所有转载都算成独立事件,硬生生凑出了 47 条「负面」。
这事之后我改了告警规则,加了一个「去重聚合」——同一原始信源 24 小时内的所有转载,只算一条,而且来源权重里把县级政务号直接降到最低。改完当天告警量从日均 30 条掉到 4 条。
这就是我想说的第二个事:告警疲劳比漏报更可怕。 一天推你 30 条,一周之后你只会点开 3 条,一个月之后你连点都不点,直接划掉。真正的大事来的时候,你也是划掉。这是所有舆情系统最致命的失败模式,但没有任何一家销售会跟你提。
被绝大多数人忽略的东西:基线
再讲一个我认为是核心、但市面上的教程基本不提的概念——没有基线的监测就是瞎猜。
假设你是个中等消费品牌,正常状态下一天全网声量 2000 条,其中负面占比在 3% 到 8% 之间波动。这就是你的基线。那什么叫异常?不是「今天有 100 条负面」——因为 100 条可能完全正常。异常是「今天的负面占比 8%,而过去 7 天的均值是 3.2%,标准差 0.8%,当前值超过均值 + 2 倍标准差」。这套东西听着玄,其实就是初中数学,你在 Excel 里拉个公式就能算。
我后来给公司做的看板里,核心指标就三个:声量的 7 日移动均值、负面占比的 Z-score、以及「新增信源数」(过去 24 小时首次出现的媒体/账号数量)。第三个指标是我自己拍脑袋加的,但它特别灵——真正的舆情爆发,一定是新账号、新媒体的持续入场;如果只是一群老账号来回转,多半是水花。
如果让我重来一次,我会这么配
不藏私,直接给方案:
- 基础层用免费的:黑猫投诉 App + 微博实时搜索 + 微信指数 + 百度指数,这四样覆盖 60% 的真正风险,成本零。
- 中间层买个便宜的 SaaS:不买最贵的,买 1 到 2 万这个档位,主要图它的全网留档和报表导出,用来给老板汇报。功能砍掉一半不要紧,别为「AI 情感分析准确率 95%」这种话术加钱——我自己拿 ChnSentiCorp 数据集微调过 BERT,测试集上能跑到 94%,但扔到真实微博语料上,遇到反讽和谐音梗,准确率直接掉到 70% 出头。「这手机真棒👍」这种话,机器到今天还是分不太清。
- 自建的话只做一件事:抓你所在的垂直行业论坛和投诉平台。别贪全,全网通吃是 SaaS 公司的活,你一个人干不过。
- 告警阈值用基线法,不用绝对值,且务必加去重聚合和来源权重。
- 每周留两小时做人工复盘,把过去一周所有告警按「真处理/误报」打个标签。三个月下来你就有自己品牌的真实误报率数据了,跟销售谈判的时候拿这个说话。
最后说句可能得罪同行的:舆情监控最该监控的第一现场,其实是你的客服工单和售后群,而不是全网。 我见过太多公司花十万买系统,结果客服那边积压的 300 条投诉工单没人看。全网都开始骂了,你才知道。这个顺序不能反。