很多同学在降重的过程中经常是面对一大片标红的文字不知所措,无从下手,甚至修改了两三遍了重复率依然还是没有变,更过分的是有的居然不降反升,这就尴尬了。那么这就要求大家对各个查重系统的规则和算法有一定的了解,针对不同的查重软件,它所收录的数据库是不一样的,其算法机制也不同。
一、知网的查重算法(关于13个字符)
目前大多数学校用的都是知网的查重软件来进行定稿,同时知网的数据库更新也是最快的,它的算法也是最新的。首先,它会将上传的论文进行格式分段检测,以句子作为最小单位来进行检测,一个句子里面如果有13个字符重复的时候,该句子就会被标红。13个字符相对于中文来说是6~7个数字。同时在一段文字里面,重复率不能超过5%。再一个就是如果一句完整的话中40%的关键词是相同的,即便它是不连贯也会标黄,如果关键词的重复率达到60%,即便是这些关键词不连贯,整句话也会标红。
举个栗子:
原句:建安文人警醒发觉,人的生命是如此短暂而脆弱。