时间:2026-07-29 编辑整理:早检测网 来源:早检测网
拿到 iThenticate 查重报告的那一刻,很多人会愣住:总相似度 28%,甚至 35%。但仔细一看,论文里的每一段都是自己写的,引用也都标了出处。
这不奇怪。总相似度高,和抄袭之间,并没有等号。
问题在于,你不能用"我没抄"三个字去跟编辑说。你得知道这个数字是怎么来的,哪些是正常的,哪些需要处理,以及怎么跟期刊交代。
https://www.zaojiance.net/iThenticate/
iThenticate 的 Similarity Index(总相似度)计算方式很直白:全文中有多少比例的文字,和数据库里的内容连续匹配上了(默认阈值是连续 6 个词)。它不管你加没加引号、标没标引用——只要字面对上了,就算进去。
换句话说,参考文献列表、规范引用、方法部分的标准化描述、甚至你自己在预印本上发过的草稿,全部会计入这个百分比。
所以拿到一个高数字,第一反应不应该是"完了",而是打开报告,看看这些匹配到底从哪来。
确认自己没有抄袭之后,高相似度几乎都可以归结为以下几类来源:
1. 参考文献列表
这是最容易被忽略的"隐形杀手"。你论文末尾的每一条参考文献——作者名、标题、期刊名、年份、DOI——都会和数据库里已有的记录匹配。一篇论文如果引了 50 篇文献,光参考文献列表就可能贡献 5%-10% 的相似度。
iThenticate 有 Exclude Bibliography 功能,可以排除参考文献列表。大多数期刊编辑在看报告时也会开启这个选项。但你自己查重时如果没勾选,数字就会虚高。
2. 直接引用内容
加了引号的直接引用,只要格式规范,系统可以识别并排除(Exclude Quotes)。但前提是格式必须"对":英文引号(直引号 " 而非中文引号 ""),或者使用缩进块引用格式。格式不对,系统识别不了,这些引用就照样算进总相似度。
3. 方法部分的标准化表述
做实验的人都清楚:方法部分的写法高度模板化。"Samples were analyzed using..."、"Data were expressed as mean ± SD"、"Statistical analysis was performed using SPSS version 26.0"——这些句子在整个学术数据库里出现了几百万次。你写出来和别人写出来几乎一模一样,不是你抄了别人,而是这个领域的表达方式就这么几种。
理工科论文(医学、工程、计算机、化学)的方法部分,往往是贡献相似度最高的章节。
4. 自引和预印本
你的论文和你之前发表的文章有重叠内容——方法复用、研究背景延续、数据集相同——系统会照样标记。更常见的情况是预印本:你在 arXiv 或 bioRxiv 上传过草稿,正式投稿时这篇预印本已经进了数据库,结果就是自己的文章和自己的草稿匹配,贡献一大块相似度。
5. 标准化声明和格式化内容
利益冲突声明、伦理审批说明、作者贡献声明、基金信息——这些内容每个期刊都差不多,几乎字字匹配。它们不是你的原创内容,但也算不上抄袭。
总相似度只是一个入口数字。经验丰富的编辑不会只看这一个百分比,他们会往下翻。
第一层:排除参考文献后的相似度。 这是大多数期刊实际参考的指标。如果你的报告总相似度 28%,开启 Exclude Bibliography 后降到 18%,编辑看到的就是 18%,不是 28%。
第二层:单源匹配比例。 报告里的 Top Sources 列表会告诉你,你和哪一篇文献重合最多。即使总相似度不高,如果某个单一来源匹配超过 5%-8%,反而比分散在几十篇文献中的小匹配更让编辑警惕。因为分散的重复看起来像写作习惯问题,集中的重复看起来像复制粘贴。有些期刊明确要求单篇来源不超过 3%。
第三层:匹配内容出现在哪个章节。 方法部分有重复,编辑通常能理解。讨论部分大段和别人重合,就不好解释了。引言里的引用密集可以接受,结果部分如果有大段匹配就很可疑。
拿到报告后,先做这几件事:
这几步下来,总相似度通常会下降 5%-15%。这不是在"作弊",这是在看一个更准确的数字。
在报告的 Sources 列表中,你可以逐个排除特定来源。最常见的操作:
排除后系统会重新计算相似度。建议下载排除前和排除后两份报告,投稿时一起附上。
过滤设置和手动排除解决的是"不该算进来的"。剩下的重复,才是你真正需要动手的。
方法部分:在不影响准确性的前提下,用自己的语言重新描述实验步骤。不要只换同义词——调整句式结构、合并或拆分步骤、加入你研究的特定参数。比如把 "The samples were centrifuged at 12,000 rpm for 10 minutes at 4°C" 改成 "Centrifugation was performed (12,000 rpm, 10 min, 4°C) using a Microfuge 200R"。
引言和讨论:这部分本来就应该有你自己的分析。如果发现大段和别人重合,说明改写不够到位。合上原文,用自己的话把观点重新组织一遍,再加引用。
结果部分:如果你的结果描述和别人的文章高度相似,检查一下是不是用了同样的表达框架。换一种呈现方式,比如把文字描述改成表格,或者调整叙述顺序。
如果排除合理来源后,总相似度仍然偏高(比如还在 20% 以上),最稳妥的做法是在 Cover Letter 里主动说明。不要等编辑来问你。
具体怎么说:
先承认数字偏高,再用数据解释来源分布。比如:
附上一份你自己整理的来源分布说明:
最后声明核心贡献的原创性:研究设计、数据采集与分析、结果解读和结论推导均为原创。
这段话的作用不是"求情",而是帮编辑快速理解情况。编辑每天看很多稿件,你给他一个清晰的解释,他就不用花时间去猜。
如果期刊因为相似度太高直接拒稿,可以申诉,但要做得规范:
申诉能不能成功,取决于你的解释是否合理、修改是否到位。如果确实存在大段未标注的复制,申诉也没用。
不要盲目追求极低数字。 总相似度低于 5% 有时候反而说明引用不足——你引用了别人的观点但没有和数据库产生任何匹配,这不太正常。大多数 SCI 期刊的合理区间在 10%-20%。
不要用"同义词替换工具"批量降重。 简单地用 QuillBot 或 Wordtune 逐句改写,改出来的文字往往语法正确但学术表达不精准,还可能引入新的错误。改写必须人工把关。
不要忽视 Exclude Small Matches 的设置差异。 你自己查重时如果用默认设置(不排除小匹配),和期刊编辑用的设置(通常排除 8 词以下匹配)可能差出 5%-10%。投稿前最好问清楚目标期刊用什么参数,或者直接复制期刊的设置来查。
不要只改文字不改结构。 编辑和审稿人看的不仅仅是匹配百分比,还看你的论文是否有独立的分析框架和论证逻辑。如果只是把别人的段落换个说法,即使相似度降下来了,审稿人也可能觉得缺乏原创贡献。
总相似度高不代表你的论文有问题。但"没有问题"需要你用数据和证据来证明,而不是靠一句"我没抄"。看懂报告、正确处理、主动沟通,这三步走稳了,大多数情况都能顺利过关。