时间:2026-07-30 编辑整理:早检测网 来源:早检测网
投SCI论文之前做查重,很多人盯着总相似度数字看,心里盘算文字部分有没有超标。但论文里不只有文字——公式、图表、代码占了相当大的比重,尤其是数学、物理、工程类文章,公式密度比正文还高。一个绕不开的问题是:iThenticate到底能不能查出这些非文字内容的重复?
投SCI论文之前做查重,很多人盯着总相似度数字看,心里盘算文字部分有没有超标。但论文里不只有文字——公式、图表、代码占了相当大的比重,尤其是数学、物理、工程类文章,公式密度比正文还高。一个绕不开的问题是:iThenticate到底能不能查出这些非文字内容的重复?
答案没那么简单。
https://www.zaojiance.net/iThenticate/
iThenticate的底层引擎是字符串匹配,它做的事情本质上是"看字符像不像",不是"看意思对不对"。碰到公式的时候,这个特点就被放大了。
用纯文本写的简单公式,比如 E=mc² 或者 y=ax+b,系统会把它当成普通文本去比对。如果你的变量名、运算符排列跟数据库里某篇文章撞上了,会被标红。这没什么好意外的——它就是一串字符,系统当然按字符来处理。
问题出在专业公式编辑器上。用MathType插入的公式对象、用LaTeX编译出来的公式块,iThenticate基本看不懂。它没法解析公式的数学结构,分不清指数、括号和上下标之间的逻辑关系。系统能抓到的只是公式里零散的文本符号——变量名、希腊字母之类的——但这些碎片化的字符比对,跟"判断两个公式是否相同"完全是两回事。
有人专门做过测试。arXiv上有一篇论文,拿两个完全不同的偏微分方程丢进iThenticate:一个是抛物型的反应扩散方程(含u_t),一个是双曲型的Klein-Gordon方程(含u_tt)。两个方程的解完全不一样,物理含义天差地别——用作者自己的话说,"就像牛和马的区别"。结果iThenticate给出的相似度是61%。因为它把两个公式里相同的字母和运算符号一个一个拆开比,发现大部分"零件"是一样的,就判定"高度相似"。
还有一个更荒诞的例子:g=1+|z|+|f|^{1/2} 和 g=(1+|z|+|f|)^{1/2},一个绝对值在外面取完平方根再加,一个先加完再整体开方,数学上完全不等价。iThenticate认为它们是同一个公式——因为它根本不认识括号。
所以对于公式查重,现状是:简单文本公式会被查,但查的是字符表面相似度,不是数学等价性;专业编辑器输出的公式对象,系统基本无能为力。目前没有主流查重软件能对数学公式做结构性比对,这件事还是得靠审稿人的眼睛。
iThenticate对图表的处理逻辑比较直白——它只读图表里的文字,不看图表本身。
图表标题、图例、坐标轴标签、数据注释,这些以文本形式存在的部分,系统会正常比对。你把别人论文的图注原封不动抄过来,大概率被标红。但图表的柱状图长什么样、折线图走势如何、散点怎么分布——这些视觉信息,系统完全不处理。
有个细节值得注意:如果你的图表是以图片格式插入的(截图、JPG、PNG),连图表里的文字都不会被识别。只有可编辑的文本内容才在检测范围内。换句话说,用Word画的表格,表头文字会被查;截图贴上去的表格,整个都不会被查。
这对SCI投稿意味着什么?图表本身的图形结构不会被查重,但图注文字、数据来源说明这些文本部分得自己注意。直接复制别人论文里的图表标题,或者把别人的图注改个日期就拿来用,这些都会留下痕迹。
计算机类论文经常涉及代码片段。iThenticate对代码的态度取决于代码的呈现形式。
以纯文本形式直接粘贴在论文里的代码,系统按普通文本规则处理。如果你的代码跟GitHub上的开源项目或者其他论文里的代码片段高度重合,会被标红。这一点不少CS领域的研究者踩过坑——觉得自己写的代码跟别人一样是"正常现象",但查重系统不管这些,字符撞了就是撞了。
如果把代码放到附录,或者用截图方式插入,系统通常识别不了代码内容,这部分就不在检测范围。不过从学术规范角度,代码引用了别人的库或者复现了别人的算法,该有的引用还是要给。
用LaTeX写论文的人需要额外留意。有机构明确指出:从LaTeX直接生成的PDF,iThenticate可能无法正常处理。原因是LaTeX编译过程中,公式、表格等元素会以特殊方式嵌入PDF,文本提取引擎可能抓不到完整内容。
德国癌症研究中心(DKFZ)图书馆的建议是:如果你的论文用LaTeX写的,提交查重时请提供一份纯文本文件,只包含文字部分,需要手动去掉所有公式、表格和图形。这听起来很麻烦,但确实是目前比较稳妥的做法。
iThenticate不管图片这件事,在学术界并不是秘密。问题是,如果有人直接复制了别人论文里的实验图像——比如一张显微照片、一个Western blot图——iThenticate完全发现不了。
这正是ImageTwin这类工具存在的理由。ImageTwin专门做学术图片查重,基于深度学习算法提取图片特征,跟PubMed、IEEE等数据库里的已发表图片进行比对。它能识别旋转、镜像、裁剪、亮度调整等常见处理手段,甚至能检测图片拼接和AI生成的图像。
目前不少SCI期刊已经在审稿流程中引入了ImageTwin或者类似工具(如Proofig)作为辅助手段。文字查重靠iThenticate,图片查重靠ImageTwin,两条线并行。但对于作者来说,投稿前主动做图片自查还不是常规操作,大多数人只做了文字查重就提交了。
对于数学、物理、工程等公式密集型论文,这个问题很实际。
公式在iThenticate里的处理方式会导致两个方向的偏差。一是虚高——系统把不同公式中的相同符号拆开比对,算出大量"伪匹配",把相似度拉高。前文提到的61%就是典型例子。二是虚低——作者为了降低重复率,把公式里的变量字母全换一遍(x换成ξ,t换成τ),系统就认为公式不同了,但实际上数学内容完全一样。
两种情况都不好。虚高可能导致编辑误判你的论文抄袭,虚低则掩盖了真正的自我抄袭。这也是为什么有学者在ResearchGate上公开质疑:用iThenticate来判定数学论文的相似度,到底合不合理?
比较务实的做法是:
表格
| 内容类型 | iThenticate能否检测 | 检测方式 | 局限性 |
|---|---|---|---|
| 纯文本公式 | 能 | 按字符比对 | 不理解数学含义,只看字符串 |
| MathType/LaTeX公式对象 | 基本不能 | 仅抓取零散符号 | 无法做结构性比对 |
| 图表文字(标题/图注) | 能 | 当普通文本处理 | 只看文字,不看图形 |
| 图表图形本身 | 不能 | 不处理图像信息 | 需配合ImageTwin等工具 |
| 图片 | 不能 | 无图像识别能力 | 完全不在检测范围 |
| 纯文本代码 | 能 | 按普通文本规则 | 开源代码可能大量重合 |
| 截图形式代码 | 不能 | 无法识别图片内容 | 不在检测范围 |
| LaTeX生成的PDF | 部分能 | 文本提取可能不完整 | 建议提供纯文本版本 |
iThenticate是一把文本查重的尺子,拿它去量公式、图片、代码,量不准是正常的。了解它能做什么、做不了什么,才能在投稿前做出正确的判断。