时间:2026-07-30 编辑整理:早检测网 来源:早检测网
打开一份查重报告,总相似度22%,看起来有点高。点开一看,参考文献列表贡献了3%-4%,图表说明贡献了1%-2%,致谢和利益声明又搭了零点几个百分点。这些加起来,凭空多了5-6个点的"假重复"。
会。而且拉得不少。
打开一份查重报告,总相似度22%,看起来有点高。点开一看,参考文献列表贡献了3%-4%,图表说明贡献了1%-2%,致谢和利益声明又搭了零点几个百分点。这些加起来,凭空多了5-6个点的"假重复"。
但这不代表你需要手动删掉这些东西。iThenticate有排除功能,编辑也知道这些部分的性质。问题在于你得搞清楚哪些是系统会自动处理的,哪些得你自己想办法。
https://www.zaojiance.net/iThenticate/
参考文献列表是拉高查重率的第一大户。原因很简单——同一条文献在不同论文里的引用格式是一样的。你用APA格式写了"Smith, J. (2020). Title of the paper. Journal Name, 15(3), 123-145.",别人也这么写,系统一比对,匹配上了。
一篇论文如果引用了40-60篇文献,参考文献列表本身就可能有1500-2000字。这些文字跟数据库里的记录高度重合,但没有任何抄袭意义。
iThenticate的解决办法是提供了一个"Exclude Bibliography"(排除参考文献)功能。在报告的过滤设置里勾选这个选项,系统会自动识别参考文献部分,把它排除在重复率计算之外。
实测效果很明显。有一篇论文初始报告显示总重复率21%,勾选排除参考文献后降到了18%。差出来的3%,全是参考文献列表的贡献。
大多数SCI期刊编辑看的就是排除参考文献后的版本。这是行业惯例,不是特殊待遇。所以你查自查重的时候,也要用排除后的数字来评估,别被初始分数吓到。
但有个坑要注意:如果你的参考文献标题没写"References"或"Bibliography",而是写了"Literature"或者把文献列表混进了脚注,系统可能识别不了这是参考文献部分,照样会算进重复率。格式规范不只是编辑的事,也影响你的查重分数。
还有一点:千万别为了降重手动删掉参考文献再查。你查的是删掉参考文献的版本,编辑查的是完整版本,结果对不上,白查。正确做法是提交完整论文,用系统功能排除。
致谢(Acknowledgments)、利益冲突声明(Conflict of Interest)、资金来源说明(Funding Statement)这些内容属于"boilerplate text"——模板性文字。
MD Anderson癌症中心的图书馆指南明确把这些列为"不需要担心的标记内容"。原因很简单:这些部分有固定格式,大家都写得差不多。"This work was supported by the National Natural Science Foundation of China (Grant No. XXXXXXXX)"这种句子,在任何论文里都长一个样。
iThenticate的系统能识别这类模板文字。在大多数情况下,编辑看到这些部分被标红,不会当成抄袭处理。
但如果你担心,可以在报告里手动排除这些来源。点开具体的匹配来源,选择"Exclude Source",这些内容就不计入重复率了。
致谢部分唯一需要注意的是:如果你直接复制了别人论文致谢里的原话(比如感谢某位具体的教授或机构),而且措辞一模一样,这确实会被标记。不过正常情况下,致谢都是各写各的,不会有人照搬别人的致谢。
这是很多人搞不清楚的地方。iThenticate检测的是文字,不是图形。
具体来说:
所以如果你的图注是直接从别人论文里复制过来的,比如"Data were analyzed using one-way ANOVA followed by Tukey's post hoc test",这句话会跟数据库里的文献匹配,算进重复率。
表格也同理。Word里直接插入的三线表,表头和单元格里的文字注释,系统都能提取。特别是带说明性文字的表格(不是纯数字的那种),跟正文重复的判定标准完全一样。
实际操作中,图表说明导致的重复通常占总相似度的1%-3%。不算多,但如果你的总相似度本来就在临界线上(比如15%),这1%-3%可能就是"安全"和"需要注意"的分界线。
怎么处理?改措辞。把"Figure 1 shows the comparison between"改成"The results are presented in Figure 1",把图注里的长句拆成短句,调整一下描述顺序。不需要大改,微调就能避开大部分匹配。
iThenticate报告里有四个主要的排除选项:
Exclude Bibliography(排除参考文献):自动识别参考文献列表,排除不计。这个必须开。
Exclude Quotes(排除引号内容):排除双引号或单引号内的直接引用。如果你论文里有大量直接引用,开这个能降不少。
Exclude Cited(排除已引用内容):排除有正确引注的内容。这个比Exclude Quotes范围更广,不只是引号内的,还包括间接引用但有标注出处的段落。
Exclude Small Matches(排除小匹配):排除短于一定字数的匹配(通常设置为8个词以下)。很多常见短语如"the results of this experiment"只有6-7个词,开这个能把这些零碎匹配过滤掉。
这四个选项组合使用,能把初始重复率压低5-10个百分点。但要注意:这些排除功能只是帮你过滤掉"假阳性",真正的重复内容不会因为开排除就消失。编辑看报告的时候也会用这些过滤,所以你要确保排除后的版本里没有真正 problematic 的内容。
iThenticate的默认检测规则是:连续6个及以上单词相同,即判定为重复。
这意味着"the results of this experiment showed that"这种常见短语,如果跟数据库里的某篇文章撞了,也会被标红。看到这种标记不用慌——6个词的匹配通常是短语层面的偶合,不是抄袭。
但如果你论文里有大段这样的"偶合"累积起来,总相似度也不好看。这就是为什么Exclude Small Matches这个功能有用——把8个词以下的匹配排除掉,剩下的才是真正需要关注的。
总结一下各部分对查重率的影响:
表格内容类型 是否被检测 典型贡献 是否可排除 编辑是否在意 参考文献列表 是(默认计入) 2%-5% 可排除 看排除后的版本 致谢/利益声明 是(但通常识别为模板) <1% 可手动排除 不太在意 图表标题/图注 是 1%-3% 不可单独排除 看具体内容 表格文字 是 1%-2% 不可单独排除 看具体内容 图片中的文字 取决于格式 0%-1% N/A 基本不看 公式中的文字 部分识别 <1% 不可排除 不太在意
这些"假重复"加起来,可能让你的初始重复率虚高5-8个百分点。排除参考文献和小额匹配之后,真正的正文重复率才是你该关心的数字。
投稿前查重的正确姿势:上传完整论文(包括参考文献、图表、致谢),跑出报告后开启Exclude Bibliography和Exclude Small Matches,看排除后的总相似度是否在目标区间。然后逐条检查Top Sources前3个来源,确认正文部分没有大段跟同一篇文献撞了。
参考文献该引用的就引用,致谢该写的就写,图表说明该规范的规范。这些部分不是你需要删掉或回避的东西——你只需要知道它们会影响初始数字,然后用系统功能把它们过滤掉。