之前评价LLM科研能力的方法,基本是拿一个想法出来让专家打分——新不新、可不可行、有没有影响力。这有个致命盲区:一个想法看着漂亮,不代表生成它的系统就有真正的科研品味。就像一个人能写出一句好诗,不等于他会写一万种风格的诗。
这篇论文换了视角:关注"分布"而非"单点"。他们定义了 research taste 的概念——一个研究者(或模型)在面对相似的文献语境时,倾向于提出什么样的研究机会、构造什么样的贡献。
论文收集了机器学习和自然科学领域的真实论文,对每篇做两件事:用LLM辅助提取核心idea(动机+方法),然后逆向工程出4-8篇最相关的前置工作,只保留标题和摘要作为输入。接着让9个主流LLM在相同context下生成idea。这样人类idea和LLM idea基于完全相同的文献基础。
论文引入了一个二维 research-taste taxonomy,不是拍脑袋定的——作者们先研究了NSF、NIH、AHRQ、DARPA的研究提案指导文件,再用150篇论文迭代校准:
Opportunity Pattern(机会模式)轴:回答"为什么要做这个研究"。7个类别——发现矛盾、缺少解释、范围不匹配、证据缺失、连接断裂文献、发现失败/风险、资源瓶颈。
Method Paradigm(方法范式)轴:回答"怎么做出贡献"。7个类别——综合统一、放松/扩展范围、鲁棒化、形式推导、实证映射、造系统、优化搜索。
翻译成大白话:LLM看到一个研究空白,第一反应是"把这些东西整合一下"。人类研究者的反应五花八门——有时候是"这里有个矛盾需要解释",有时候是"这个假设可以放松",有时候是"现有方法在这个场景会失败"。
把所有idea映射到共享embedding空间后,发现不同模型家族对同一个输入的相似度(0.8316)甚至高于人类与任一模型的相似度(0.72-0.78)。模型之间比模型和人类之间更像。
概念分析更直接:模型偏向multi-omics integration(95%模型份额)、diffusion policy(93.1%)、multimodal generation(91.2%)这类高频概念簇。人类则更关注局部机制——trajectories(63.5%人类份额)、tokenization、equivariance、entropy等。
一个反直觉的发现:开启thinking模式后,Qwen3-8B和DeepSeek-V4-Flash的synthesis比例反而进一步升高到36.1%和28.6%。推理能力让模型把"缝合"做得更自洽了,但没有拓宽品味。模型在模板化方向上走得更远。
这篇论文的结论不是"LLM不能做科研",而是"LLM目前能做的科研只有一种口味"。如果你用LLM做头脑风暴,它会不断给你"把A和B结合"类建议。这些想法单独看合理,但你会错过所有其他类型的贡献机会——发现矛盾、放松假设、识别失败模式、构造新工具。
更根本的问题是:这个品味窄化可能跟预训练数据有关,也可能跟RLHF偏好"安全合理"的回答有关。在模型能够真正做出像人类一样多样的研究贡献之前,至少应该意识到这个gap的存在。用LLM做科研辅助时,人类的品味和判断仍然不可替代。