Turnitin AI 检测测试 2026:GPT-5.5, Claude Opus 4.8 & Gemini 3.1 Pro 结果
结论:Turnitin 的 AI 检测效果显著。我们测试了 9 篇由三个前沿模型生成的 AI 文本——其中包含经过专门人工润色处理的文本——Turnitin 均一一识别了出来。与此同时,真实人类撰写的文本得分均为 0%。以下是详细分析。
我们为何进行此项测试
AI 写作工具无处不在。ChatGPT、Claude 和 Gemini 已被学生、研究人员和内容创作者广泛日常使用。Turnitin 已部署在超过 16,000 所机构中,是学术诚信领域事实上的“守门人”,其 AI 检测功能正日益成为判断论文是否会被标记的关键依据。
以下三个问题备受关注:
Turnitin 真能识别出最新 AI 模型生成的文本吗?
诸如重写、提示词工程等“人性化”处理手段,真的能降低 AI 检测评分吗?
Turnitin 是否会将人类真实创作的内容误判为 AI 生成?
我们开展了一项受控测试,旨在解答上述所有问题。
我们是如何测试的
模型
截至2026年年中的三个前沿模型:
ChatGPT (OpenAI GPT-5.5)
Claude Opus 4.8
Gemini 3.1 Pro
三种写作模式
针对每个模型,我们采用三种方式生成文本:
模式 | 操作过程 | 测试目的 |
|---|---|---|
直接生成 | 提示模型撰写关于海洋垃圾分解的内容,不附加额外指令。 | 基准AI检测率 |
拟人化重写 | 先生成文本,再要求模型“使其听起来更自然、更像人类”进行重写。 | 事后编辑是否能规避检测 |
拟人化要求 | 在初始提示词中直接加入拟人化指令。 | 提示工程是否能规避检测 |
所使用的具体提示词已记录在附录中。
人类对照组
为了测试误报率,我们提交了大型语言模型出现前的真实人类撰写的内容:
3篇来自真实法律文件的摘录(如《美国宪法》、《权利法案》——语言正式且高度结构化)
9段以上来自2015年之前的学术论文(如学位论文致谢、经济学论文——不可能由AI生成)
主题与篇幅
所有AI文本均围绕海洋垃圾分解展开——这一中立且客观的主题有助于保持各模型输出的一致性。每篇文本至少包含3个段落,以确保Turnitin有足够的样本进行分析。
考虑到Turnitin按次收费的成本,我们将多篇文本合并后进行分组提交(每次提交不超过4篇)。
结果
AI检测得分
模型 | 写作模式 | AI得分 |
|---|---|---|
GPT-5.5 | 直接生成 | 100% |
GPT-5.5 | 人性化重写 | 100% |
GPT-5.5 | 人性化要求 | 100% |
Claude Opus 4.8 | 直接生成 | 100% |
Claude Opus 4.8 | 人性化重写 | 100% |
Claude Opus 4.8 | 人性化要求 | 100% |
Gemini 3.1 Pro | 直接生成 | 100% |
Gemini 3.1 Pro | 人性化重写 | 100% |
Gemini 3.1 Pro | 人性化要求 | 95% |
人类文本结果
文本类型 | AI得分 |
|---|---|
法律文件(美国宪法,权利法案) | 0% |
2015年前的学术论文 | 0% |
截图:Turnitin AI 检测报告
GPT-5.5
直接生成 — AI: 100%

人工润色重写 — AI: 100%

结合人工润色要求 — AI: 100%

Claude Opus 4.8
直接生成 — AI: 100%

人工润色重写 — AI: 100%

结合人工润色要求 — AI: 100%

Gemini 3.1 Pro
直接生成 — AI: 100%

人工润色重写 — AI: 100%

结合人工润色要求 — AI: 95%

人类文本
真实法律文件 — AI: 0%

2015年前学术论文 — AI: 0%

分析
1. Turnitin 检测出了所有内容
在三个不同的前沿模型和三种不同的写作策略测试中,Turnitin 标记了每一篇 AI 生成的文本。没有漏掉任何一篇。
最低得分率为 95%——这依然是一个明确无误的“AI 生成”判定信号。没有任何老师在看到 95% 的 AI 检测结果时,会认为“这或许是人类撰写的”。
2. 拟人化处理无效
我们测试了两种最常见的拟人化(humanization)策略:
生成后重写:“让这段文字听起来更像人类写的。”
生成前提示词工程:“像一个有思想的人类一样写作,不要像模板一样。”
结果均无效。 GPT-5.5 和 Claude 的检测得分始终保持在 100%。Gemini 从 100% 微降至 95%——这种微小的变化完全可以忽略不计,它依然在强烈地暗示“我是 AI”。
这向我们揭示了一个重要事实:Turnitin 并非仅仅关注过渡词或句式统一性等表面特征。它所检测的模式(极有可能是词汇选择、句法和结构中的统计学规律)即便在进行改写、重组和风格调整后依然存在。
将这些文本进行比对,经过拟人化处理的版本确实在阅读体验上有所不同。句子长度的变化更丰富,公式化的过渡词减少了,部分段落还采用了更具观察性的语气。但 Turnitin 看穿了这一切,其底层信号过于强烈。
3. 人类文本零误报
这一点同样至关重要。当我们提交正式的法律文本和 2015 年之前的学术论文进行测试时:
《美国宪法》和《权利法案》:0% AI。这些文本高度结构化且正式——恰恰是评论家们担心会被误判的那类文本。
2015 年之前的学位论文和经济学论文:0% AI。这些作品创作于 GPT 问世之前,因此 Turnitin 准确地将其识别为人类撰写。
“担心 Turnitin 会将正式、结构化的人类写作误判为 AI 生成”是针对 AI 检测工具最常见的质疑之一。但在我们的测试中,这种担忧并未出现。
4. 为什么 Gemini 3.1 Pro 的得分降至 95%
数据中唯一的特例是采用拟人化要求的 Gemini 3.1 Pro,其得分为 95% 而非 100%。这段文本有何不同之处?
篇幅更长(5 个段落,直接生成版为 4 个段落)
以叙事场景开篇(“站在海滩上……”)
使用了更多的反问句和反思性语言
句子的长度和节奏变化更为多样
尽管如此,95% 依然是一个确凿的 AI 标记。这种差异在学术研究上或许有趣,但在实际应用中毫无意义——没有人会把 95% 的得分误认为是人类写作。
关键要点
Turnitin 的 AI 检测极其精准
在 9 篇 AI 生成的文本中,有 8 篇的检测率达到 100%,剩下的一篇也高达 95%。 Turnitin 并非基于概率进行猜测,而是能够以近乎完美的一致性,可靠地识别出源自三个不同前沿模型的 AI 生成内容。
“去 AI 化”是死胡同(针对 Turnitin)
“AI 人工润色”行业声称能让生成的文本无法被检测到。我们的测试表明,至少在应对 Turnitin 时,这些说法站不住脚:
生成后改写:完全无效
生成过程中进行人工干预:效果微乎其微(一个模型下降了 5%,另外两个完全无效)
Turnitin 所检测到的模式非常底层——即便经过改写、重构和风格调整,这些特征依然存在。
Turnitin 不会误报人类原创作品
我们的对照组 AI 检测得分均为 0%。正式的法律文书和学术论文——即评论家们所担心会被误判的文体——都被准确地识别为人类创作。基于我们的测试结果,对于正式和学术类写作而言,有关“误报”的担忧似乎是毫无根据的。
局限性
请明确说明此测试所涵盖及未涵盖的范围:
样本量:包含 9 组 AI 生成文本和 2 组人类撰写文本。样本具有参考意义,但并非详尽无遗。
单一主题:所有 AI 文本均围绕海洋垃圾展开。个人叙述或创意类主题可能会呈现出不同的模式。
仅限正式写作:我们仅测试了信息类散文,未涉及创意写作、诗歌或技术类内容。
特定时间点的快照:Turnitin 会不断更新其算法。以上结果仅反映 2026 年 7 月的情况。
合并提交:为控制成本,文本进行了分组处理。尽管 Turnitin 是在句子层面进行评估,但这在理论上仍可能影响评分。
未使用对抗性技术:我们仅测试了直接的人性化处理,并未测试激进的混淆手段(如字符级扰动、故意制造错误、回译等)——这些方法通常会严重降低文本质量,使其失去使用价值。
这意味着什么
对于学生
如果你正在使用AI生成文本,并心存侥幸希望Turnitin检测不到——它一定能发现。在我们的测试中,检测率基本达到了100%。
更好的方法是:将AI作为辅助工具,而非替代品。你可以用它来进行头脑风暴、梳理论点或润色文笔,但要始终以你自己的见解和语言风格为核心。如果确实使用了AI辅助,请务必根据所在机构的政策保持透明。
对于教育工作者
Turnitin的AI检测是一个可靠的参考信号,但它仅是一个信号,而非最终裁决。即使AI得分达到100%,也应将其作为沟通的契机,而非直接进行自动惩罚。请审查学生的写作记录、探讨作业内容,并全面考量各种背景因素。
我们的测试同样证实,正式且结构严谨的人类写作不会触发误报。对于0%的AI得分,你可以相当放心地采信。
对于内容创作者
如果你需要创作能够通过AI检测的内容,指望通过主流模型生成文本后再进行所谓的“人工润色”是很难绕过Turnitin的。最可靠的策略依然是亲自撰写内容,仅将AI作为辅助工具使用。
测试方法论参考
参数 | 详情 |
|---|---|
测试日期 | 2026年7月 |
测试模型 | ChatGPT (GPT-5.5), Claude Opus 4.8, Gemini 3.1 Pro |
AI 文本 | 9篇(每个模型3篇,涵盖3种写作模式) |
人类文本 | 法律文件(3段摘录),2015年前学术论文(9段以上) |
主题 | 海洋垃圾降解 |
最小长度 | 每篇文本不少于3段 |
检测工具 | Turnitin AI 检测 |
提交方式 | 合并文档(单次提交不超过4篇文本) |
附录:所使用的提示词
为了确保完全可复现,以下是每个写作模式所使用的确切提示词。这些提示词在所有三个模型中均被统一采用。
提示词 1:直接生成
Please write a short article about "the degradation of marine litter" in English.
Requirements:
1. The article should contain at least three paragraphs.
2. Discuss the sources of marine litter, its environmental impacts, the difficulty of degradation, and the importance of reducing marine pollution.
3. Use a clear and formal style suitable for a general science or environmental awareness article.
4. Do not use headings or bullet points.
5. Do not include fabricated statistics, studies, organizations, or citations.
6. Keep the writing coherent and logically structured.
提示词 2:拟人化重写
此提示词应用于提示词 1 的输出结果——即要求模型修改其生成的文本。
Please revise the following article to make it read more naturally, as if it were written by a real person with a thoughtful writing style.
Revision requirements:
1. Preserve the original meaning, main ideas, and overall topic.
2. Do not add fabricated statistics, studies, organizations, cases, or citations.
3. Vary the sentence length and rhythm so the writing does not feel overly uniform.
4. Reduce mechanical transitions such as "firstly," "secondly," "moreover," "in conclusion," or similar formulaic phrases.
5. Make the tone more natural while still keeping it professional and clear.
6. Avoid making the article too casual or conversational.
7. Keep at least three paragraphs.
Original article:
[Paste the original article here]
提示词 3:嵌入拟人化要求的生成
此提示词用于一次性生成——即将拟人化要求直接写入初始提示词中,而非事后再进行修改。
Please write a short article about "the degradation of marine litter" in English.
Content requirements:
1. The article should contain at least three paragraphs.
2. Discuss the main sources of marine litter.
3. Explain why marine litter, especially plastic waste, is difficult to degrade in ocean environments.
4. Describe its impacts on marine life, ecosystems, and human society.
5. Mention the importance of reducing marine litter and improving waste management.
Writing style requirements:
1. Write in a natural and thoughtful style, as if the article were written by a real person rather than generated from a fixed template.
2. Avoid making every paragraph follow the same structure.
3. Vary sentence length and rhythm.
4. Include a few natural observations or reflections where appropriate.
5. Avoid overusing formulaic transitions such as "firstly," "secondly," "finally," or "in conclusion."
6. Do not use headings or bullet points.
7. Do not include fabricated statistics, studies, organizations, cases, or citations.
8. Keep the writing clear, accurate, and suitable for general readers.
关键设计决策
这三个提示词旨在验证一个特定假设:通过简单的提示词重写,能否降低 Turnitin AI 的检测得分?
提示词 1 代表了最常见的应用场景——即学生将作业要求直接粘贴到 ChatGPT 中并提交其输出内容。
提示词 2 模拟了流行的“文本拟人化”工作流程——即先由 AI 生成初稿,再要求其改写,使其听起来不那么刻板。
提示词 3 测试了在初始提示词中直接植入拟人化要求,是否比事后修正更有效。
这些提示词特意规避了编造统计数据和引用文献,从而确保测试专注于模型的写作风格,而非其内容的真实性。
最终结论
Turnitin 的 AI 检测以令人信服的结果通过了此次测试。它成功捕获了全部三个前沿模型(GPT-5.5、Claude Opus 4.8 和 Gemini 3.1 Pro)生成的文本,检测率高达 100%(仅一例为 95%)。对于人类创作的文本,其误判率为 0%。所谓的“人性化”润色技巧并无实质性作用。
仅靠简单的提示词改写无法绕过 Turnitin 的 AI 检测。这是我们此次测试得出的最重要结论。我们尝试了两种不同的策略——生成后的文本改写以及生成前的风格指令注入——但均告失败。针对 GPT-5.5、Claude Opus 4.8 和 Gemini 3.1 Pro 的测试结果高度一致:无论提示词如何调整,Turnitin 都能精准识别出 AI 痕迹。Turnitin 所捕捉的统计学模式深植于文本底层,简单的表面风格调整根本无法掩盖。
结论显而易见:如果你通过 Turnitin 提交 AI 生成的文本,一定会被检测出来。避免被标记为 AI 的最佳方式,依然是亲自撰写内容。