Consensus AI

关注
义项:AI学术搜索工具

Consensus AI 是一款面向科研文献的人工智能搜索工具,由 Consensus 公司开发,2022 年上线,创始人为埃里克·奥尔森(Eric Olson)和克里斯蒂安·萨利姆(Christian Salem)[1]。用户以自然语言提问,系统在超过 2.2 亿篇同行评议论文的语料库中检索,并给出可回溯到原文的结论与引文[2][3]。它把生成式摘要限定在真实文献范围内,因而被多所高校与医院图书馆作为循证检索的辅助工具引入试用[4]。

百科 图文
目录
  1. 定义
  2. 原理
  3. 发展历程
  4. 应用
  5. 局限
  6. 参见

定义

Consensus AI 是一个以学术论文为语料库的人工智能检索与文献分析工具,用户输入自然语言问题,系统返回相关研究并生成带引文的结论摘要[2][3]。它的定位介于传统文摘数据库与通用对话式 AI 之间:检索先行,回答只依据检索到的真实论文,若找不到足够证据会直接说明,而不用外部信息补齐[2]。

所用语料覆盖自然科学多个学科,收录同行评议期刊论文,也包含预印本、会议论文与学术图书,其中涵盖 PubMed 的全部内容[2][5]。语料由 Semantic Scholar、OpenAlex 等来源与平台自身的网页抓取汇总而成,数据库按周更新[2]。

原理

一次检索分三步完成。第一步用语义向量检索与传统关键词检索并行的混合方式,从全部语料中筛出与问题相关的文献,候选规模约为 1,500 篇;第二步按发表时间、被引次数与期刊影响力等质量信号收缩范围;第三步由更强的模型对排在最前的约 20 篇重新排序[2][3]。当全文可得时,检索范围可延伸到方法、结果、讨论等章节,而不局限于标题与摘要[2]。

其后由大语言模型阅读并比较多篇论文,抽取方法、样本量与结果等要素,归纳文献中的一致与分歧之处[2]。为便于核对,平台把摘要中的每一条引文对应到论文原文中的具体句子,并标出该句所在的章节[5]。

对可以“是”或“否”作答的问题,系统会生成 Consensus Meter,用图形展示文献中支持、反对与存疑三类立场的比例[3]。面向复杂任务的多智能体系统 Scholar Agent 建立在 GPT-5 与 Responses API 之上,由负责规划、检索、阅读与分析的多个代理分工协作,完成多步骤研究任务[6]。


flowchart TD

A[用户用自然语言提问] --> B[混合检索 语义向量与关键词]

B --> C[按被引次数与期刊影响力筛选]

C --> D[对排在最前的论文重新排序]

D --> E[逐篇抽取原文引语]

E --> F[生成带引文的合成结论]

发展历程

Consensus 由埃里克·奥尔森与克里斯蒂安·萨利姆创办,两人曾是西北大学橄榄球队队友,公司随后迁至波士顿一带[1]。产品于 2022 年上线,最初形态是科学领域的垂直搜索引擎:为学术论文建立索引、检索相关结果并生成以引文为基础的摘要[1][6]。据一项中文研究介绍,该平台上线后较早获得 Draper Associates 等早期风险投资机构的投资,语料库最初以 Semantic Scholar 的论文摘要信息为基础构建[7]。

2024 年 8 月,公司完成 1,150 万美元的 A 轮融资,由 Union Square Ventures 领投,Nat Friedman、Daniel Gross 等参与;当时其月活跃用户超过 40 万,年化收入接近 200 万美元,较上一年增长逾 600%,用户主要来自学术界、医疗与生物科学领域。

2024 年至 2025 年间,平台从单一检索扩展为研究工作台,加入面向多步问题的深度检索功能,可在数分钟内生成包含核心研究、引文、可视化结果与文献空白的报告[4]。2025 年,OpenAI 的客户案例称其用户超过 800 万、营收较前一年增长约 8 倍[6]。

2026 年,平台语料规模由约 2.5 亿份文献增至 4 亿份以上,并与 APA、Wiley、SAGE、牛津大学出版社等出版商建立合作,使部分付费内容也能进入检索;同期面向开发者开放了 API 与 MCP 接口[5]。耶鲁大学图书馆、梅奥诊所图书馆等机构在此期间先后开展试用或提供机构访问[8]。

应用

高校与医疗机构图书馆是主要使用场景之一。耶鲁大学图书馆自 2025 年起开展为期一年的试用,向校内师生开放至 2026 年 12 月 31 日,并建议将其与 Web of Science、PubMed 等数据库配合使用。苏黎世联邦理工学院图书馆面向校内成员提供专业版访问。梅奥诊所图书馆则为其研究人员开通机构许可,并把结果与馆藏订阅的全文打通[8]。

在具体用法上,研究人员、学生与临床医生用它完成文献综述起步阶段的工作:快速判断某篇论文是否值得细读,提取研究设计、样本量与结果,比较不同研究的结论,并借由引文链接回到原文核对[8][9]。针对临床问题,平台提供医疗模式,可把检索范围聚焦到医学证据[6]。

它也被研究者当作系统综述的辅助检索工具加以检验。一项以大数据领域为案例的研究把它与人工主导的综述流程逐项比对,以精确率、召回率与 F1 值衡量其检出文献的准确性,并提出由 AI 加快检索、由人工把关质量与深度的混合工作方式[10]。

局限

检索覆盖的完整性存在缺口。在上述大数据领域的案例研究中,人工流程确认了 32 篇主研究,Consensus 检出 22 篇,其中 16 篇与人工结果重合、5 篇为误检,对应精确率 76.2%、召回率 38.1%、F1 值 50.6%,即检索结果较准但不够全面[10]。该研究还发现其入选论文的平均被引次数为 202 次,明显高于人工选择的 64.4 次,提示可能偏向高被引文献,同时存在引用信息不准确、批判性分析不足等问题[10]。

学科与问题类型的适用范围有限。其语料以自然科学为主,社会科学覆盖相对薄弱,艺术与人文学科基本不覆盖;对可以用“是/否”回答或询问概念间关系的问题效果最好,提问方式不契合时,Consensus Meter 等 AI 功能可能无法生成;检索命中的文献总数也不向用户显示[9]。

生成式输出仍需人工核对。苏黎世联邦理工学院图书馆提示,AI 生成的结果有可能不完整、具有误导性或不正确,使用者不应只依赖这些输出,而应自行检索并批判性评估。梅奥诊所图书馆同样指出,此类工具可以简化文献发现过程,但无法替代对来源的批判性评估[8]。

使用额度也构成限制。免费账户每月提供 20 个 AI 点数,用完后仍可进行普通检索,但无法使用 AI 摘要与合成功能[9]。

参见

  • 大语言模型 —— Consensus AI 的文献摘要与结论合成依赖这类模型。

  • 语义检索 —— 其检索阶段采用的两种方法之一。

  • 系统综述 —— 常借助该工具完成初步检索的研究工作流。

  • 同行评议 —— 其语料库收录文献的主要类型。

  • OpenAI —— 其部分底层模型技术的提供方。

  • PubMed —— 与 Consensus AI 常被并列使用的生物医学文献数据库。

参考资料

  1. dailynorthwestern.com 上的网页 . dailynorthwestern.com [引用日期2026-09-29]
  2. How Consensus Works | The Consensus Help Center . consensus.app [引用日期2026-09-29]
  3. FAQs | The Consensus Help Center . consensus.app [引用日期2026-09-29]
  4. AI-powered and evidence-based research with Consensus . ethz.ch [引用日期2026-09-29]
  5. consensus.app 上的网页 . consensus.app [引用日期2026-09-29]
  6. Consensus 運用 GPT-5 和 Responses API 在幾分鐘內完成數週的研究 . openai.com [引用日期2026-09-29]
  7. 中国科技期刊知识服务技术路径探析——以Consensus.app为例 . chinaxiv.org [引用日期2026-09-29]
  8. News from Mayo Clinic Libraries . mayo.edu [引用日期2026-09-29]
  9. PROJECT MUSE* . jhu.edu [引用日期2026-09-29]
  10. doaj.org 上的网页 . doaj.org [引用日期2026-09-29]
词条评价
词条统计

浏览次数:0 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-09-29T09:00:50Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
PubMed 系统综述 大语言模型 语义检索 系统综述 同行评议 OpenAI PubMed
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。