首页论文检测教程iThenticate能查公式重复率吗?SCI稿件中公式、图表、代码的查重真相

iThenticate能查公式重复率吗?SCI稿件中公式、图表、代码的查重真相

时间:2026-07-30 编辑整理:早检测网 来源:早检测网

投SCI论文之前做查重,很多人盯着总相似度数字看,心里盘算文字部分有没有超标。但论文里不只有文字——公式、图表、代码占了相当大的比重,尤其是数学、物理、工程类文章,公式密度比正文还高。一个绕不开的问题是:iThenticate到底能不能查出这些非文字内容的重复?

投SCI论文之前做查重,很多人盯着总相似度数字看,心里盘算文字部分有没有超标。但论文里不只有文字——公式、图表、代码占了相当大的比重,尤其是数学、物理、工程类文章,公式密度比正文还高。一个绕不开的问题是:iThenticate到底能不能查出这些非文字内容的重复?


答案没那么简单。

iThenticate查重系统入口

https://www.zaojiance.net/iThenticate/


公式查重:能查,但查得很笨


iThenticate的底层引擎是字符串匹配,它做的事情本质上是"看字符像不像",不是"看意思对不对"。碰到公式的时候,这个特点就被放大了。


用纯文本写的简单公式,比如 E=mc² 或者 y=ax+b,系统会把它当成普通文本去比对。如果你的变量名、运算符排列跟数据库里某篇文章撞上了,会被标红。这没什么好意外的——它就是一串字符,系统当然按字符来处理。


问题出在专业公式编辑器上。用MathType插入的公式对象、用LaTeX编译出来的公式块,iThenticate基本看不懂。它没法解析公式的数学结构,分不清指数、括号和上下标之间的逻辑关系。系统能抓到的只是公式里零散的文本符号——变量名、希腊字母之类的——但这些碎片化的字符比对,跟"判断两个公式是否相同"完全是两回事。


有人专门做过测试。arXiv上有一篇论文,拿两个完全不同的偏微分方程丢进iThenticate:一个是抛物型的反应扩散方程(含u_t),一个是双曲型的Klein-Gordon方程(含u_tt)。两个方程的解完全不一样,物理含义天差地别——用作者自己的话说,"就像牛和马的区别"。结果iThenticate给出的相似度是61%。因为它把两个公式里相同的字母和运算符号一个一个拆开比,发现大部分"零件"是一样的,就判定"高度相似"。


还有一个更荒诞的例子:g=1+|z|+|f|^{1/2} 和 g=(1+|z|+|f|)^{1/2},一个绝对值在外面取完平方根再加,一个先加完再整体开方,数学上完全不等价。iThenticate认为它们是同一个公式——因为它根本不认识括号。


所以对于公式查重,现状是:简单文本公式会被查,但查的是字符表面相似度,不是数学等价性;专业编辑器输出的公式对象,系统基本无能为力。目前没有主流查重软件能对数学公式做结构性比对,这件事还是得靠审稿人的眼睛。


图表查重:只看文字,不看图形


iThenticate对图表的处理逻辑比较直白——它只读图表里的文字,不看图表本身。


图表标题、图例、坐标轴标签、数据注释,这些以文本形式存在的部分,系统会正常比对。你把别人论文的图注原封不动抄过来,大概率被标红。但图表的柱状图长什么样、折线图走势如何、散点怎么分布——这些视觉信息,系统完全不处理。


有个细节值得注意:如果你的图表是以图片格式插入的(截图、JPG、PNG),连图表里的文字都不会被识别。只有可编辑的文本内容才在检测范围内。换句话说,用Word画的表格,表头文字会被查;截图贴上去的表格,整个都不会被查。


这对SCI投稿意味着什么?图表本身的图形结构不会被查重,但图注文字、数据来源说明这些文本部分得自己注意。直接复制别人论文里的图表标题,或者把别人的图注改个日期就拿来用,这些都会留下痕迹。


代码查重:取决于你怎么放进去


计算机类论文经常涉及代码片段。iThenticate对代码的态度取决于代码的呈现形式。


以纯文本形式直接粘贴在论文里的代码,系统按普通文本规则处理。如果你的代码跟GitHub上的开源项目或者其他论文里的代码片段高度重合,会被标红。这一点不少CS领域的研究者踩过坑——觉得自己写的代码跟别人一样是"正常现象",但查重系统不管这些,字符撞了就是撞了。


如果把代码放到附录,或者用截图方式插入,系统通常识别不了代码内容,这部分就不在检测范围。不过从学术规范角度,代码引用了别人的库或者复现了别人的算法,该有的引用还是要给。


LaTeX用户的特殊麻烦


用LaTeX写论文的人需要额外留意。有机构明确指出:从LaTeX直接生成的PDF,iThenticate可能无法正常处理。原因是LaTeX编译过程中,公式、表格等元素会以特殊方式嵌入PDF,文本提取引擎可能抓不到完整内容。


德国癌症研究中心(DKFZ)图书馆的建议是:如果你的论文用LaTeX写的,提交查重时请提供一份纯文本文件,只包含文字部分,需要手动去掉所有公式、表格和图形。这听起来很麻烦,但确实是目前比较稳妥的做法。


图片抄袭怎么办?iThenticate管不了,但有别的工具


iThenticate不管图片这件事,在学术界并不是秘密。问题是,如果有人直接复制了别人论文里的实验图像——比如一张显微照片、一个Western blot图——iThenticate完全发现不了。


这正是ImageTwin这类工具存在的理由。ImageTwin专门做学术图片查重,基于深度学习算法提取图片特征,跟PubMed、IEEE等数据库里的已发表图片进行比对。它能识别旋转、镜像、裁剪、亮度调整等常见处理手段,甚至能检测图片拼接和AI生成的图像。


目前不少SCI期刊已经在审稿流程中引入了ImageTwin或者类似工具(如Proofig)作为辅助手段。文字查重靠iThenticate,图片查重靠ImageTwin,两条线并行。但对于作者来说,投稿前主动做图片自查还不是常规操作,大多数人只做了文字查重就提交了。


实际影响:公式对查重率到底有多大干扰?


对于数学、物理、工程等公式密集型论文,这个问题很实际。


公式在iThenticate里的处理方式会导致两个方向的偏差。一是虚高——系统把不同公式中的相同符号拆开比对,算出大量"伪匹配",把相似度拉高。前文提到的61%就是典型例子。二是虚低——作者为了降低重复率,把公式里的变量字母全换一遍(x换成ξ,t换成τ),系统就认为公式不同了,但实际上数学内容完全一样。


两种情况都不好。虚高可能导致编辑误判你的论文抄袭,虚低则掩盖了真正的自我抄袭。这也是为什么有学者在ResearchGate上公开质疑:用iThenticate来判定数学论文的相似度,到底合不合理?


比较务实的做法是:


  • 用专业工具(MathType、LaTeX)编写公式,让系统把它们当成不可解析的对象,减少伪匹配

  • 公式周围的文字说明尽量用自己的话写,不要把"其中α为温度系数,β为摩擦系数"这类句式跟别人写得一字不差

  • 如果查重报告里公式相关部分标红严重,在cover letter里跟编辑说明情况,附上公式来源引用

  • 通用符号和标准表达(如 p<0.05、F=ma)的少量重合通常不会被计入,不必过度担心


总结一下各部分的查重能力



表格

内容类型iThenticate能否检测检测方式局限性
纯文本公式按字符比对不理解数学含义,只看字符串
MathType/LaTeX公式对象基本不能仅抓取零散符号无法做结构性比对
图表文字(标题/图注)当普通文本处理只看文字,不看图形
图表图形本身不能不处理图像信息需配合ImageTwin等工具
图片不能无图像识别能力完全不在检测范围
纯文本代码按普通文本规则开源代码可能大量重合
截图形式代码不能无法识别图片内容不在检测范围
LaTeX生成的PDF部分能文本提取可能不完整建议提供纯文本版本




iThenticate是一把文本查重的尺子,拿它去量公式、图片、代码,量不准是正常的。了解它能做什么、做不了什么,才能在投稿前做出正确的判断。



在线咨询
在线留言
系统列表
返回顶部