
TL;DR:Trellner Research 于 2026 年 9 月 2 日对 Perplexity 的 Sonar 与 Sonar Pro 进行了一次软件推荐研究,覆盖 380 个品类、760 次调用。公开数据中的 7,534 条引用里,59.8% 对应 Tranco 前 10 万之外或未入榜的域名,但三个被报告识别为模板站的网站只占引用的 2.4%;这两个比例都不是“虚假引用率”。研究揭示的是来源构成,没有证明这些页面改变了推荐答案,也不能外推到所有 AI 搜索产品。
答案后面跟着链接,通常会让人安心一点。读起来仿佛有据可查,总有一份材料能解释推荐从何而来。
但链接只让追查成为可能,并不替我们完成追查。推荐软件时,真正的问题是:页面是谁写的,比较依据是什么,它是否支持眼前这条结论,以及几个看似不同的网站是否真的提供了独立证据。
🎬 视频版(B站) | 🎧 音频版(7 分 50 秒)| 🟢 Spotify 订阅 | 📖 偏好阅读?文字版就在下方 👇
这项研究到底测了什么
研究者通过 OpenRouter,向两档 Perplexity 模型提出相同的软件购买问题,每个预先选定的品类各调用一次,要求输出排名前五的产品及官方域名。类别名单不是现实用户查询的随机抽样,而且包含小众行业;模型答案也没有反复采样。研究方法
为了核对数据,编辑本文时下载了作者公开的引用 CSV、推荐 CSV 和站点地图汇总,并重新计算计数。得到 760 组“模型—品类”记录、3,800 个推荐位置、7,534 条引用,涉及 2,055 个不同域名,与报告相符。
这一步验证的是公开数据与报告数字是否一致,不是重新运行了一次 Perplexity 实验,更不是证明每一条原始抓取都正确。读者可以从作者的 CC BY 4.0 数据目录 取得材料继续检查。
59.8% 不是虚假来源比例
以下数字由公开快照重新计算,分母均为引用记录数,不能理解成网站数量或推荐错误率:
| 统计对象 | 引用条数 | 占全部引用 |
|---|---|---|
| 排名在前 10 万之外,或未进入 Tranco 百万名单 | 4,508 | 59.8% |
| 完全未进入该 Tranco 百万名单 | 1,766 | 23.4% |
| Worldmetrics、Gitnux、WifiTalents 三站合计 | 181 | 2.4% |
前两行是包含关系,不应相加;第三行按站点身份统计,与前两行也不是互斥分类。引用数据
Tranco 是流行度排名。研究使用的 K9QPW 名单生成于 9 月 1 日,综合了此前 30 天的多份排名,并非文章可靠性认证。该版 Tranco 名单
小众开发者的文档、新创公司的技术说明和专业领域资料,都可能不在高流量网站之列。把“长尾来源很多”直接解释成“垃圾很多”,不仅超出证据,也会误伤那些本来就不靠大众流量生存的知识。

图:依据 Trellner 2026-09-02 快照重算;页面数量与引用份额不是同一个指标,图中分类也不要求互斥。
二十一万页,和进入答案的次数是两回事
公开站点地图汇总分别记录了 Worldmetrics 的 70,731 页、Gitnux 的 71,684 页和 WifiTalents 的 72,713 页软件榜单路径,合计 215,128 页。这衡量页面规模,不是说一次实验抓取或引用了全部页面。站点地图汇总
原报告还描述了相同模板、品牌互相介绍,以及部分页面以“事实与依据”为自我定位的现象,并将共同运营视为推断而非所有权证明。Trellner 原报告
这些现象足以提示我们检查来源独立性,却不能单靠共享托管服务或相似版式认定欺诈。署名、审核徽章和结构化数据可以说明页面怎样表达自己,但不等于外部已经核验过其专业性。
采购时可以继续问:这篇比较有没有测试条件、版本、评价标准和可追溯的作者经历?如果只有一串产品名称和结论,无论页面设计得多正式,证据仍然不充分。
内容营销也可能成为推荐依据
在公开引用 CSV 中,Guideflow 出现 194 次,排在 G2 和 Reddit 之后,超过 Gartner 的 158 次。原报告将它描述为销售交互式演示工具的厂商,并明确没有据此指控其内容具有欺骗性。
这值得讨论的不是“厂商博客一律不能用”,而是利益关系和专业范围。产品方通常最清楚自己的功能,却未必是比较整个市场的中立裁判;反过来,评测机构的名字也不能免除方法审查。
如果同一个榜单声称覆盖很多差别极大的行业,我们应继续看:它真的分别测试过,还是只把各产品的宣传语重新排列?推荐结果能否根据预算、部署方式和数据要求做出解释,比“第一名”三个字更重要。
两档模型一致,也可能只是看了同一批材料
按公开 CSV 的引用顺序分组比较,380 个品类中有 289 个返回相同的引用 URL 列表。研究者因此把两档模型视为同一检索体系的两次观察,不当作两个独立系统互相验证。
这里需要区分“重复得到相同结果”和“获得独立支持”。若两位顾问都抄了同一篇榜单,他们的一致不能算两份实验。模型之间也是如此:换一个档位、换一次提问,未必就换了证据来源。
Perplexity 的官方提示指南说明,Sonar 会在响应的 citations 和 search_results 字段返回来源。调用方可以利用这些信息检查证据,而不是只展示链接数量。Sonar 官方文档

节目封面。博客头图是原创概念插画,不是对特定网站后台的实拍。
“引用了”与“因此推荐了”,还差一个因果问题
研究没有移除这些来源后重新比较答案。它也没有给所有推荐产品逐一做质量评测,所以不能从这些数据推出“某个软件只是因为模板站才被推荐”。
引用列表可能包含背景材料、比较文章或产品信息。要证明某份文档改变了排名,还需要设计可比较的干预实验,控制提示词、检索配置、模型与时间,并重复采样。
这不是替可疑页面开脱,而是在区分已观察到的现象和仍待验证的解释。来源有问题,值得调查;最终推荐是否因此错误,要有进一步证据。
产品名称正确,还要单独确认网址
原报告记录了产品名与目的域名错配的案例。这提醒我们,推荐质量与访问安全是两项独立检查:即使产品确实适合,错误网址仍可能把下载、登录或付款带到别处。
不要在 AI 给出的首个链接上直接输入账号或付款。可以从产品已有的官方文档、已知发布组织、应用商店记录或可信目录交叉确认身份,再核对跳转后的实际域名。网页出现验证码、403 或 429 也不能直接证明厂商已经倒闭;网络访问失败和业务不存在必须分开判断。
对于需要高权限安装的软件,这一步还应包括发布者、签名、下载渠道和更新方式。能搜索到一篇“最好用”的文章,不构成把设备权限交给安装包的理由。
下次问 AI 推荐软件,可以多问四句
- 这条结论由哪一段原文支持? 请把功能事实、用户评价和推荐判断分开。
- 这些来源是否独立? 检查作者、运营主体和是否共同转述同一份材料。
- 比较是否适用于我的条件? 明确预算、团队规模、部署方式、版本和数据要求。
- 官网与下载地址怎样核验? 把网址身份检查与产品优劣比较分开完成。
AI 可以帮我们形成候选名单,但候选名单不是采购决定。引用的价值在于让人能够检查,而不是让人不必检查。
收看本期节目
原始资料与延伸阅读
本文由《听懂 AI》第 028 期访谈整理而成,核对日期为 2026 年 9 月 4 日。主要依据 Trellner Research 的 TR-2026-009 报告及其 CC BY 4.0 数据集,本文已重算部分计数,但没有重新采集网页或再次调用模型复现实验。研究只覆盖 2026 年 9 月 2 日的一次 Perplexity API 快照,不能代表其他搜索系统或现实查询分布;共同运营、页面生成方式与推荐因果关系应分别判断。Tranco 与 Sonar 文档为编辑阶段补充,使用建议属于编辑分析。
- Trellner Research 原报告 — 2026-09-02,TR-2026-009;本期主要来源。
- 公开数据与脚本 — CC BY 4.0,归属 Trellner Research;本文计数基于这一公开快照。
- METHOD.md 与 README.md — 抽样、字段、抓取和已知限制。
- Tranco K9QPW — 研究采用的排名版本与聚合时间窗口。
- Perplexity Sonar Prompt Guide — 来源返回字段与使用说明。
- Hacker News 讨论入口 — 来自本期 RSS;未用于证明报告结论或所有权关系。