
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
既加了只有我自己知道的项目踩坑细节,没有改变任何参数的正确性,还把原本连续的低困惑度长句拆成了碎片,句长方差直接拉大。很多人不知道,海外的AI检测工具核心指标是基于英文语料训练的困惑度,靠统计词和词之间的共现概率判断内容是不是符合大模型的生成分布,但中文的语言逻辑和英文完全不一样,再加上国内大部分中文大模型的预训练语料里,技术文档类的书面语表达范式高度统一,开发者写技术文档的时候用的“首先、其次、

2024年9月,某双非院校计算机学院的毕设预抽检现场,12篇通过知网重复率检测、重复率均低于10%的论文,被新上线的AI内容排查工具标记为高风险,人工复核后确认其中8篇的核心章节全部或大篇幅由大模型生成。不少一线审核人员对AI生成文本特征分析的认知还停留在“行文太通顺、没有口语化表达就大概率是AI写的”,这种浅层判断已经完全跟不上当前大模型的迭代速度,甚至经常出现严重误判。

上周帮内容组赶一批公号原创稿,偷懒用了个网上找的在线工具降AI检测率,结果还没等我们发稿,洗稿号已经把完整的稿子发出来了。我当时第一反应就是,降AI工具会不会泄露文章?那批稿子是内容组熬了两周磨的行业深度稿,之前投过两次平台预审,AI生成内容检测率卡在了27%,离要求的15%阈值差不少。我当时图省事,没多想就把整包7篇原稿导进了那个在线工具,半小时后导出的版本检测率直接压到了8%,我当时核对了下核

总有一些特殊业务场景,不需要严格按唯一键或者全字段去重,比如要求两个字典里的手机号相同就算重复,不管其他字段是不是有差异。这种场景下完全没必要套前面的固定方案,自己维护一个去重判定的集合就行,想怎么定规则就怎么定规则。# 补全用户列表的手机号字段演示{"id": 1, "name": "张三", "age": 24, "phone": "13xxxxxx11"},{"id": 2, "name":

把这6个特征的打分和之前的熵值打分按权重整合之后,我整个脚本的检测准确率直接拉到了89%,我后来专门拿50份标注好的测试样本做对比,其中20份是纯人工手写的,15份是GPT4生成的,15份是半人半AI的混合内容,朱雀AI检测助手的免费版准确率只有78%,哪怕是它的付费基础版准确率也才85%,比我自己微调出来的脚本还低4个百分点。接下来的两天我把朱雀AI检测助手的所有公开规则摸得明明白白,它根本不存

第二个是句段分布熵,这个维度90%的免费检测工具都没做,我之前拆过几个开源的检测脚本,里面连统计句长分布的代码都没写。我当时给学弟调整内容的思路特别简单,根本没瞎换同义词,对着检测报告里标红的每一段低困惑度内容,一句一句换成带他个人专属实验经历的表述,比如原AI生成的“新能源汽车BMS系统的迭代速度近年逐步提升”,直接改成“我去年在实验室测这个功能的时候,连续刷了3版固件才把SOC估算的误差压到5

2024年6月我蹲在某985高校计算机系毕设答辩后排旁听,一上午47个答辩组里,至少有11组的答辩PPT备注里露了ChatGPT的输出残留格式,对应的AI写论文痕迹藏得有深有浅。当天结束我找答辩组的老师聊,他们说现在每年收到的毕设里,有AI生成痕迹的占比已经超过40%,但能被常规查重系统抓出来的不到15%。很多学生默认只要把AI生成的内容丢去降重工具转一遍,就能顺利蒙混过关,很少有人能说清楚这类内

2024年6月我蹲在某985高校计算机系毕设答辩后排旁听,一上午47个答辩组里,至少有11组的答辩PPT备注里露了ChatGPT的输出残留格式,对应的AI写论文痕迹藏得有深有浅。当天结束我找答辩组的老师聊,他们说现在每年收到的毕设里,有AI生成痕迹的占比已经超过40%,但能被常规查重系统抓出来的不到15%。很多学生默认只要把AI生成的内容丢去降重工具转一遍,就能顺利蒙混过关,很少有人能说清楚这类内

这篇文章专门解决你用生成式AI写技术笔记、博客初稿时,提交到平台后被判定为内容重复、甚至直接被标记为非原创的头疼问题。大部分人对AI降重的认知都停留在“改语序换同义词”的层面——放到普通文案里还行,放到技术内容里根本没法用,要么把专有名词改得面目全非,要么改完逻辑完全出错,反而得不偿失。我整理了自己大半年写技术博客攒下的实用方法,不用绕弯子,照着做就能把内容重复率压到平台要求的阈值以下,还不会出错

拆解AI写作落地技术内容场景的底层逻辑,纠正认知误区,提升内容生产效率。








