
先说结论。LLM 正在深度进入科研流程但一项建模研究发现科学家把 LLM 放进日常工作后最可能的变化不是“做得又好又快”而是“做得更多、但做得不够好”。这里的“更多”指论文数量、实验初稿、分析草稿、文献摘要量都显著增加“不够好”指结论的新颖性、论证的完整性、结果的可复现性和整体科学质量出现下降。这不是某个具体模型的运行结果而是对科研系统动态的一种建模预测提醒我们不要只盯着效率数字。这个主题主要适合几类人看正在用 LLM 做文献综述、写论文、写代码、处理数据的科研人员需要为实验室或课题组制定 AI 使用规范的负责人以及参与同行评审、需要判断论文是否出现“模型化”倾向的审稿人。最值得关注的问题不是“能不能用 LLM”而是“怎么判断 LLM 到底在提升科研质量还是在透支科研判断力”。下面按实际使用场景拆一遍。先看建模预测的核心含义再梳理 LLM 在科研流程中确实能提效的环节然后讲清楚质量下降的典型信号最后给一套可以直接落地的校验方法和排查清单。1. “做得更多、但做得不够好”到底在预测什么1.1 先看懂这个预测的三个层次“科学家使用 LLM 会做得更多、但做得不够好”这句结论可以从三个层面理解。第一层是产出效率。LLM 能快速生成文献摘要、研究思路、代码片段、论文初稿、回复意见。以前一个博士生需要一周写完的文献综述初稿现在可能两三个小时就能完成。这是“更多”的来源。第二层是质量风险。效率提升的代价是认知参与度下降。当一个研究者不再逐句阅读文献而是依赖模型生成的摘要他对研究细节的判断力可能被削弱。模型输出流畅但流畅不等于正确。当这类行为在科研群体中扩散就会出现“系统层面的质量衰减”论文数量上涨但领域内真正的新思想、新方法占比下降。第三层是系统反馈。建模研究尤其要看的不是单个研究者用一次 LLM 的结果而是长期使用后整个科研系统的变化。例如如果大量论文依赖相似的模型生成那么同一个研究方向的内容会趋于同质化如果审稿人也用 LLM 简要处理稿件那么对低质量内容的拦截能力可能下降。这是一个闭环工具使用越普遍系统的筛选效率越低。1.2 为什么“做得更好”比“做得更多”难得多“做得更多”为什么容易因为 LLM 几乎把所有需要“从零开始”的环节都变成了“从草稿开始”。写作有初稿代码有骨架综述有摘要邮件有模板。对科研人员来说这些本来就是耗时环节模型介入后启动成本大幅降低完成数量自然上升。“做得更好”为什么难因为科研质量的核心不在于文本生成而在于判断和质量控制。一个研究结论是否可靠要看实验条件、数据来源、统计方法、假设前提、可复现性一篇文章是否有价值要看它是否提供了新的角度、解决了新的问题。这些不是“生成更多文本”能解决的。恰恰相反文本越多越容易掩盖判断上的空缺。还有一个更隐蔽的问题当模型输出的文本看起来很专业人脑很容易产生“这已经完成得差不多了”的错觉。校对成本降低了真实核查却没有跟上。于是研究者投入的深度思考、批判性检验、重复实验反而变少。“更多”变成了高压环境的产物“更好”被让位给了速度和流畅度。我在实际观察中发现的规律是最容易出问题的不是完全不用 LLM 的人也不是把 LLM 放在一边做辅助的人而是“遇到什么任务都先让模型生成一版然后简单修改就提交”的人。后者看起来高效实际上把质量控制的责任悄悄移交给了模型。1.3 谁受这个效应影响最大从建模预测的角度看受影响最大的是三种人。第一种是刚进入领域的研究生。他们还没有形成完整的文献判断力如果一开始就依赖 LLM 生成摘要和综述容易把模型的归纳当作权威结论。实验可以等到结果出来再验证但文献理解的偏差往往在很久之后才暴露。第二种是发文压力大、需要在短时间内产出大量内容的研究者。时间紧张会让“先让模型做再回头校”变成“让模型做我只看结论”。这个过程中数据核对、来源检查、逻辑推演都可能被压缩。第三种是大量使用 LLM 批量处理任务的团队。一个人工修改一篇 AI 生成初稿质量尚可一百篇都靠 AI 生成、少数几个人修改质量就会明显下滑。因为修改者不可能对每一篇都深入了解真实研究背景。不是说这些人不能用 LLM而是说用得越重越需要补上“人工深度判断”的环节。模型负责规模和效率人负责标准和验证。2. LLM 在科研流程中提升效率的真实环节2.1 文献综述与检索整理文献综述是 LLM 最明显的提效场景。给出一段研究主题模型可以快速生成相关研究方向的概论、整理关键词、列出代表性工作。和纯人工逐篇阅读相比速度提升是数量级的。但这里有一个容易踩的坑模型的文献综述是基于训练资料和海量网页内容生成的它不会自动区分“真实存在的论文”和“其他文章里隐约提到的工作”。如果你去核查参考文献很可能会发现某些引用根本不存在或者标题、作者、年份对不上。我的建议是把 LLM 的综述输出当成“线索提供器”不是“最终答案”。先用它明确研究方向的子问题、术语和分类再回到数据库里逐篇核实。更稳妥的做法是把从数据库检索到的论文原文丢给模型让它基于你提供的文本生成摘要。这样模型处理的是你指定的内容而不是它记忆里的内容。2.2 代码辅助和数据处理科研编程中LLM 能显著缩短写代码的时间。数据清洗、格式转换、画图、统计检验只要描述清楚需求模型能给出大体可运行的脚本。对不常写代码的科研人员来说这是巨大的效率提升。但代码质量和科研有效性并不总是同一个概念。模型给出的代码可能能跑但跑法不对可能适合小型测试数据但放到完整数据集上就会出问题可能用了某个库的过时接口虽然不报错但结果已经和预期不符。更危险的是如果连“期望结果”都不清楚只是让模型“帮我分析一下这些数据”模型会默认生成一堆描述性统计和图表看起来结果丰富实际上很可能完全没有针对研究假设。科研数据的价值在于检验假设不在于生成尽可能多的图表。把数据分析外包给 LLM 之前先要把研究问题、因变量、自变量、对照组、统计方法确定下来。2.3 论文写作和润色LLM 在论文写作中的最大价值是帮助非英语母语研究者跨越语言障碍。把粗糙的中文思路转成英文学术表达把重复啰嗦的段落压缩成清晰的论证这些都是非常实用的功能。相比依赖人工翻译或付费润色服务模型成本更低、反馈时间更短。但问题是语言质量的提升会掩盖论证质量的下降。作者可能会把更多时间花在让文本“看起来专业”上而忽略了一个更关键的问题论证本身是否成立。一篇文字流利但没有数据支撑的文章比一篇语言朴素但数据扎实的文章更容易被接受吗短期可能更容易因为审稿人也是人会被流畅的表达影响判断。但长期看这个策略既没有增加科学价值也可能透支研究者的信誉。我的建议是先用中文把自己的实验设计、数据结果、逻辑链条完整写出来再交给 LLM 做结构优化和语言润色。不要让 LLM 从零开始替你“写实验结论”。结论是你自己的语言可以由模型帮助表达。2.4 假设生成与实验设计这是 LLM 最吸引人、也最有风险的场景。让模型根据现有文献提出一些研究假设它确实能给出大量意想不到的组合。对探索性研究这能拓宽思路对跨学科课题它能帮你找到自己领域很少接触的方法。但假设生成和想当然只有一步之遥。模型生成的假设可能看起来合理但它并不清楚你的设备条件、样本可得性、实验周期和预算。一个在理论上成立的假设在现实中可能根本无法检验。另一个问题是生成的假设太多研究者反而会倾向于选出最容易验证的那个而不是最有价值但最难验证的那个。这又回到了“做得更多、但做得不够好”。更合理的用法是把模型的生成结果当作“候选假设池”然后人工给每个假设打分。标准包括可检验性、理论依据、数据可得性、与现有知识体系的一致性。筛选之后只保留最值得做的一到两个不要因为生成成本低就同时推进十个。3. 质量下降的四个典型信号以及如何识别3.1 同质化不同文章的结论模式越来越像如果你发现团队里多篇论文的结构、措辞、甚至调研思路高度相似这很可能不是巧合而是大家都用了相同的 LLM 和相似的提示词。模型给的是概率上最接近训练分布的结果十个人问同一个主题回复可能大同小异。判断标准很简单把几篇“不同”文章的研究背景和讨论部分放在一起看论证路径是否高度重复。如果每一篇都从同一个切入点开始用几乎同样的逻辑顺序推进就要警惕模型正在限制研究视角的多样性。避免同质化的方法一是强制要求每个研究者先独立提交自己的思路和关键词再参考 LLM 输出二是给模型设置不同的提示词让它从否定已有结论、寻找反例、跨领域类比等不同角度生成论点三是在团队内保留“未使用模型独立初稿”的对照。3.2 流畅但证据稀薄模型生成文本的特征是语言流畅、结构完整这也正是它危险的地方。研究者很容易把“看起来很完整”当成“内容很扎实”。一个段落如果逻辑连接词漂亮、术语准确阅读者往往会降低警惕不再追问数据的出处和实验条件。识别这类问题有一个实用动作把每个关键断言单独拎出来问三个问题——依据是什么、数据在哪里、能否复现。LLM 生成的文本通常能给出漂亮的论断但当你追问依据时它往往只会重复已有的通用知识无法指向具体的原始实验。这个缺口就是质量下降的信号。3.3 审稿流程被信息过载影响科研系统里还有一个容易被忽视的质量衰减路径审稿人开始接收大量由模型辅助生成的论文但这些论文并没有真正提高领域质量反而占用了更多审稿精力。如果一个稿件表面上整齐、术语正确、格式规范但缺少真正深入的实验细节审稿人很容易给出“还可以”的评价。对于审稿人我的建议是改变审查顺序先看数据、方法、结论之间的逻辑链再看表达。不要被流畅的引言和讨论带走。对作者来说也意味着不要用模型生成的华丽表达去掩盖核心内容的不足因为这会改善第一印象但无法通过实验复现这一步。3.4 用检索替代推理当一个人习惯了“先把问题丢给 LLM 获取答案”他会慢慢减少自己寻找原始文献和独立推导的过程。这不是主观上偷懒而是认知路径依赖既然模型能给出不错的方向为什么还要花大量时间读原文问题在于科研中最有价值的推理常常发生在阅读原文和核对数据的过程中。模型给出的答案是压缩和平均后的结果而你看到原文时的疑问、联想的反例、对实验细节的质疑这些都不会出现。把检索外包给模型短期提高效率长期却削弱了形成独立科研问题意识的能力。识别方法如果你发现自己读完一个主题的十个摘要最终记住的只是模型的概括具体实验细节、样本量、统计方法都没有留下印象就需要减少摘要式浏览回到原文阅读。4. 给科研人员的防“降级”实操清单4.1 为每个科研环节明确“人机边界”最有效的防降级方法是在使用之前就明确哪些环节必须人工完成哪些环节可以交给模型。我给自己划分的标准是文献定位和检索可以交给模型但最终阅读和判断必须回到原始论文。代码骨架和格式转换可以交给模型但统计方法和关键参数必须由研究者自己确认。论文初步语言润色可以交给模型但研究结论、数据解释和局限性讨论必须由作者亲自撰写。假设生成和实验思路可以让模型提供候选但实验设计、可行性判断和优先级选择必须由人决定。审稿意见起草可以让模型整理表达但技术判断和最终决定不能交给模型。这不是一套硬规定而是一个思路只要一个环节的“最终判断标准”超出文本生成范围就必须保留人在回路里。4.2 用“过程审计”替代“结果抽查”很多人验证 LLM 输出质量的方式是“看一眼结果觉得差不多就行”。对零散任务这也许足够对科研任务这是不够的。更可靠的方式是过程审计记录每个关键结论是从哪份文献、哪次实验数据、哪个统计结果得来的。具体做法可以是每次使用 LLM 辅助科研时维护一个“人机协作日志”。日志里写明三件事让模型做了什么、模型给的结果是什么、人工做了什么验证。不需要写得多详细只需保证任何关键结论都能回溯到原始依据。我见过不少科研团队采取“结果抽查”事后发现有问题却很难定位是哪一步出了差错。过程审计看似麻烦实际是快速排查问题的关键。它不会拖慢流程反而能在返工时节省大量时间。4.3 控制模型输出风格避免“模型腔”LLM 默认输出往往会带有明显的模板特征尤其是在提示词不够具体的时候。这类文本的典型特征是开头先给背景接着讲现状再列三点好处最后给一个展望。放在科普文章中没有问题但用在科研论文里会让所有内容显得同质化。调整方法有三个层面。第一在提示词中明确要求“直接给出结论”“不要使用套话”“不要重复已知背景”把输出风格往观点密度高的方向拉。第二根据任务类型调节采样参数。如果任务是整理事实或润色语言可以把 temperature 调到较低值比如 0 到 0.3 之间减少随机性如果任务是生成新假设、拓展思路可以适当调高温度但输出之后必须经过严格筛选。第三如果模型给出的段落明显是“什么都很全、什么都没讲透”不要急着保留要求模型重写或者人工精简只保留有信息量的句子。4.4 建立结论验证的底线规则无论 LLM 在文本生成上表现得多好科研结论的最终验证必须依赖真实数据、可复现实验和独立审查。这个底线不能因为效率提升而松动。一个可执行的底线规则是凡是出现在论文摘要、结论、图表标题里的断言都必须能关联到具体的实验或数据来源。模型生成的任何一句“研究表明”如果无法定位到原始出处就不能直接进入最终正文。这需要研究者在把模型输出写入稿子之前做一次“引用、数据、结论一致性检查”。为了保证规则可操作可以把它设计成三步标红把模型生成稿中的所有结论性语句标记出来。溯源为每一条结论找到对应的实验数据、文献或统计结果。删除找不到来源的结论性语句要么补充验证要么直接删除。这三步看起来简单却是防止“模型腔掩盖证据缺失”的有效手段。5. 从团队协作角度看怎么用 LLM 才不会降低整体产出质量5.1 把 LLM 定位成“第一轮分析员”而不是“最终作者”个人使用时人机边界靠自觉。团队使用时边界必须变成协同规范。我比较推荐的方式是把 LLM 当作“第一轮分析员”让它先做一些信息整理、结构梳理、候选方案盘点但最终的研究报告、论文投稿和代码提交必须由团队成员署名负责。这样做的好处有三点。第一过程被外部化模型中间结果不会不经检查就直接进入正式成果。第二责任边界清晰出现问题时可以利用日志定位是模型生成错误还是人工修改错误。第三新成员可以从“人工修改模型输出”入手逐步熟悉领域知识而不是被模型输出牵着走。5.2 用双盲对照评估 LLM 是否真的提升了质量很多团队引入 LLM 后只汇报了“效率提升”却从不评估“质量变化”。效率提升很容易观察半小时写完全文初稿、一周做完文献综述。质量变化却很难观察因为被评估的文本往往已经过了人工修改。更可靠的做法是在团队内随机抽一批任务做双盲对照。给一组研究人员提供 LLM 辅助另一组不提供让他们完成同样的文献调研或数据分析再让第三方按统一标准打分对比两类产出的质量差异。如果 LLM 组速度更快质量持平或更高那确实值得广泛使用如果速度更快但质量明显下降就要重新评估使用边界。这种对照测试一开始规模可以很小不需要立项大动干戈。抽两三个课题、每个课题分两组完成同一个准备任务结果就很有参考意义。5.3 建立可追踪的 LLM 使用记录团队使用 LLM最怕的是“来无影去无踪”。有人用模型生成了文献综述有人用模型写了代码有人用模型润色了论文但没有留下任何记录。一旦论文被质疑关键结论依据不足无法定位是哪一步出了问题。解决办法是建立轻量级的使用记录表。记录字段可以很简单日期、成员、任务类型、使用的模型或工具、模型的输入提示词、模型输出要点、人工修改点、是否经过验证。不需要把每次对话都完整保存但至少要保留关键输入和人工修改链路。这个记录既是排查工具也是审计证据。如果将来实验室需要回应关于研究诚信的质疑这些记录能清楚说明问题边界如果只是日常协同它也能帮助新成员看到前辈如何处理模型输出。5.4 保留“无模型路线”作为对照团队全面拥抱 LLM 后很容易形成一种组织惯性所有任务都先问模型。这种惯性会慢慢关闭研究者独立探索的空间。为了对抗这种惯性我建议在每个关键研究项目中至少保留一条“无模型路线”。这条路线不一定要和大流程完全隔离但可以设定为研究启动阶段由成员先独立完成初步问题定义、文献阅读和假设提出之后再引入 LLM 进行扩展和查漏。通过这样的对比团队能持续看到“独立思路”和“模型思路”之间的差异。这对于研究多样性非常重要。尤其在新方向探索的前两周如果你发现团队所有成员提交的初步框架都非常相似那基本可以断定大家都在向同一个工具要答案而没有自己的问题。6. 判断标准与排查如何及时发现自己已经在“做得更多、却更差”的路上6.1 三类指标效率、质量、验证成本要判断 LLM 的引入是否在侵蚀科研质量可以定期关注三类指标。第一类是效率指标。包括单篇文献综述耗时、论文初稿完成时间、数据处理脚本编写时间、图表生成时间等。效率指标用来观察“做得更多”是否真实发生。第二类是质量指标。包括结论的新颖性、同主题文章之间的区分度、引用准确性、实验可复现性、审稿人的具体意见。质量指标用来判断“有没有做得更好”。第三类是验证成本指标。包括团队成员核对文献的平均时间、返工次数、实验复现失败率、论文被质疑依据时定位问题的耗时。验证成本指标是很多人忽略的维度。如果模型把产出速度提高了但每个产出都需要额外两小时去核验那净收益并没有表面上看那么大。建议每季度做一次轻量对比挑两个相似任务一个以人工为主一个以 LLM 辅助为主记录上述三类数据。不需要做复杂实验只用真实任务就行。6.2 如果发现质量在下降先检查这些环节如果你已经观察到一些不利信号比如论文被拒率上升、文献引用错误增多、团队产出趋于同质化排查时不要一上来就怀疑模型能力不够而是按顺序检查以下环节提示词是否过度固定。团队里是不是都在用同一套提示词模板如果是输出同质化是必然结果。输入材料是否经过整理。模型生成文献摘要时是直接基于训练记忆还是基于你提供的原文后者明显更可靠。人工检查是否发生在正确位置。很多人只检查最终成稿却忽略了中间的假设生成、数据分析和代码逻辑。文本表面光鲜但数据链路早就有问题。验证成本是否被忽视。如果团队把大量时间花在核实模型输出上这就是一种隐性损耗说明模型没有真正省下时间只是把工作从生成阶段搬到了验证阶段。团队成员是否还在独立思考。如果你发现大家习惯性先问模型而不是先形成自己的判断这就是认知退化信号不能再只靠流程解决。6.3 什么情况下应该果断减少 LLM 使用有些场景下减少甚至暂停 LLM 使用是更合理的选择。当任务高度依赖领域核心判断时。例如实验设计中的对照组选择、临床研究中的结局指标定义、数据统计方法的选择这些环节出错代价很高且判断依据很难在短文本中完全表达人工深度参与更稳妥。当可验证性要求极高时。如果一份研究结论要被审计、复现或用作决策依据那么生成过程中的每一步最好都能追溯到人类判断。模型可以作为辅助但不宜承担核心推理。当团队已经出现明显的同质化倾向时。如果连续多份报告从结构到措辞都高度相似建议暂停通用 LLM 辅助改用原始数据人工分析直到团队重新建立起多样化的思考方式。还有一种更实际的情况当模型输出需要大量修改才能符合要求而修改成本接近重新编写时彻底放弃 LLM直接人工完成反而更高效。不要被“AI 就是快”的惯性绑架具体任务要具体评估。最后说一个我在实操中的体会。LLM 对科研的真正价值不是帮你把一份报告变厚也不是帮你把一段文字变顺而是在你不熟悉的方向上快速建立地图。地图能让你少走弯路但决定走哪条路、怎么验证那条路能不能走通仍然是你自己的事情。那些真正做得更好的人不是用 LLM 替代思考而是用 LLM 节省出更多时间去验证、挑战和改进自己的思考。这个判断同样适用于团队。单次使用 LLM 的质量问题可以通过人工修改解决系统性的质量下滑必须通过规范人机边界、记录验证过程、保留独立对照来对抗。如果你的论文数量在涨、但研究带给你的深度满足感在降那就该停下来重新检查自己是在用模型辅助科研还是让模型替自己做科研了。