StealthGPT AI Humanizer 评测
StealthGPT 是一款面向学生、SEO 写作者和文案撰写者的隐身写作工具,也是少数公开检测器数据并注明样本量的供应商之一, 在 Turnitin 上为 98% human,在 GPTZero 上为 95%,两者均基于 30 篇文档。其 20,000 词单次运行对长文件确有优势。本评测涵盖这些数据、退款保证,以及引擎如何处理学术文档中的引文、术语和语体。
StealthGPT 将两个检测器数据放在产品前端, 98% 的 Turnitin 人类平均值, 30 次检测中为 0, 以及 95% 的 GPTZero 人类平均值, 30 次中为 0, 并以一项退款保证作为支持, 如果订阅者的输出被检测到则退款。其自身材料对受众的命名同样直白, 学生, SEO 写作者和专业文案撰写者。
这篇评测只按一项任务来判断它, 学术文档。论文章节或期刊稿件包含参考文献表, 已定义的概念, 报告的统计结果, 以及导师在第一段就能识别的语体。这比 StealthGPT 自我设定的测试更窄, 但如果你的文件要交给评阅者, 这才是重要的测试。
大学实际上允许什么
在大多数机构中, 在自己的草稿上使用 AI 是被允许的, 而公开规则取决于披露。COPE 关于 AI 工具的立场给出了 governing principle, 工具不能对作品负责, 因此人类作者必须负责, 并且必须说明工具做了什么。
Nature 允许在写作过程中使用生成式 AI, 但不允许将其列为作者, 而 Oxford 将 AI 视为合法的学习支持, 未经说明的使用则构成违规。引用该工具的问题也同样已经解决, APA 发布了引用 ChatGPT 的格式, 将该模型视为带有版本和日期的软件, 而我们关于 在论文中引用 ChatGPT 的指南采用了各院系预期的表述。
为什么 AI 草稿需要人类化
原始模型的行文是通用的。句子以统一长度出现, 段落以相同的平淡连接词开头, 研究者本会作出明确判断的地方却堆叠着缓和语气, 各部分又以公式化总结收尾。我们关于 暴露 AI 写作的词语和短语 的目录列出了这些特征。
第二个问题是测量。Turnitin, GPTZero, Originality.ai 和 Pangram 会对一段文字的可预测性进行评分, 即每个词如何紧接前文而来, 以及句长变化有多小。生成的行文会得到很高的可预测性评分, 因为可预测性正是语言模型优化的目标。我们关于 AI 检测器如何工作 的说明文介绍了其机制。
Turnitin 还增加了一个细节。其 AI 指示器覆盖已经被人类化或经过 bypasser 处理的文本, 并且会单独标记那些很可能使用 AI paraphrase tool 修订过的文本。重写并不保证不可见, 这就是为什么没有任何 humanizer 能对某一具体文档的检测器结果作出承诺。
AI Humanizer 如何工作
- 变化句子结构。 拆分, 合并和重排对检测器读数的影响最大, 因为句长变化是直接测量的。
- 替换模型典型词汇。 生成文本中反复出现的词汇本身就是一种信号, 替换它会改变质感而不触及结构。
- 调整语体。 通用 humanizer 以会话语体为目标, 因为这正是其客户发布的内容。在学术行文中, 这一目标会缩短从句, 删除承载意义的限定语, 并把可读性拉低到稿件所需范围以下。
StealthGPT 是什么, 它如何工作
StealthGPT 位于市场中的 stealth writing 角落。它重写生成文本, 明确目标是让分类器将输出评分为人类文本, 并将该输出呈现为可直接发布的成品内容。贯穿始终的成功衡量标准是检测器结果。

其声明的受众是学生, SEO 写作者和文案撰写者, 其语体覆盖通用内容和 SEO 写作, 以及论文和社交帖子。这些文档共有一个特征, 文本就是交付物, 而其中很少有结构性内容会被打断。
公开发布的检测器数据
StealthGPT 发布了两项带有明确样本的数字, Turnitin 的人类平均值为 98%, 30 次检测中为 0, GPTZero 的人类平均值为 95%, 30 次中为 0。其后还有一项退款保证, 如果订阅者的输出被检测到, 就退还服务费用。
这一点值得肯定, 因为该类别中有不少供应商只发布一个裸百分比, 没有任何支撑。明确的样本数量意味着该主张可以被审视, 而退款意味着供应商承担了一部分风险。
弱点在于样本规模。30 份文档对于一个关于分类器每年对数百万提交进行评分的主张来说, 规模很小, 而在 30 个样本上表现干净, 既可能说明工具很好, 也可能只是样本恰好适合它。这些数字没有附带数据集, 选择方法或日期。TextPulse 自身的基准测试覆盖一个 2,000 份文档的学术语料库, 报告 Turnitin AI 为 92.33%, Originality.ai 为 89.12%, GPTZero 为 87.91%。两组数字都由供应商测量, 而且大 60 多倍的样本显然是更强的证据。
方案与容量
StealthGPT 列出三个层级, Pro, Samurai 和 Enterprise。容量主张是其突出之处。Enterprise 方案在一次 humanization 运行中最多可处理 20,000 个词, 这在该类别中是一个很高的单次上限, 因为许多工具一次只处理几千词。当文档被分成多次处理时, 术语会在片段之间漂移, 时态会在接缝处变化, 而高单次上限可以直接消除这一失效模式。
| 层级 | StealthGPT 的说明 |
|---|---|
| Pro 和 Samurai | 命名的订阅层级。价格, 未说明 |
| Enterprise | 一次 humanization 运行最多 20,000 个词。价格, 未说明 |
| 保证 | 如果订阅者的输出被检测到, 退款 |
谁在使用它
StealthGPT 描述的是其购买者本身, 即某个批量生产 SEO 文章, 着陆页或客户文案的人, 其商业要求是检测器读数。对这类购买者而言, 退款保证是有意义的, 而文本内部没有脆弱之处。
用一份像你的文档来测试它
公开的平均值和退款都描述的是别人的文档。真正重要的是你自己的文本会返回什么, 而 200 个词足以进行初步阅读。粘贴一段与你提交内容相似的文字, 保留引文, 保留术语名, 包含一个报告的统计结果。一个干净的样本只能说明输出是流畅的。
然后并排阅读两个版本。姓氏, 年份和页码是否完全一致? 每个已定义术语是否以方法部分给出的形式返回? 数字是否未被改动? 我们免费的 burstiness checker 显示了这次处理实际引入了多少句长变化。
将你自己的论文人性化
改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。
引文, 术语, 统计和语体
StealthGPT 的材料没有说明引文处理, 术语锁定或学术语体目标, 这与其所命名的受众相符。社交帖子没有参考文献表, SEO 文章也没有已定义的概念或效应量。
学术文档同时具备这三者, 而一个没有相应规则的重写引擎会把每一项都当作普通行文。引文是最清楚的例子。像 (Steiner and Borg, 2023, p. 88) 这样的括号引文, 对一般重写器来说只是需要变化的词语。姓氏会被改动, 括号内容会并入句子, 页码会消失, 而叙述式引文会变成一个失去归属的释义。每一次编辑读起来都很流畅, 但每一次都会破坏评阅者会拿你的参考文献表核对的内容。
已定义术语承受着同样的风险。方法部分命名的概念, 量表或仪器, 必须在后续每次提及时逐字保留, 而追求变化的重写器在设计上正好相反。统计结果是第三种情况, p 值, 置信区间和效应量如果不能改写, 就会变成错误。
容量优势使这种风险更高, 而不是更低。一次处理 20,000 个词意味着工具可以处理整章, 而整章正是包含最多引文, 已定义术语和报告数字的文档。没有引文处理能力的容量, 仍然会丢失参考文献表。
TextPulse 正是围绕这个问题构建的。引文和参考文献条目在 APA, MLA, IEEE, Chicago, Harvard 和 Vancouver 中都逐字保留, 无论是括号式还是叙述式。Freeze terms 会在处理前锁定任何概念或仪器名称, 统计结果, 效应量和化学式会自动保留。语体保持在 Flesch-Kincaid 13 到 18 年级区间, 引擎在同行评审的人类写作上训练, 每次处理都会报告一个估计的 Human Score。Pricing 为 Pro 每月 $19, 25,000 个词, 每次 500 个词, Plus 为 $29, 50,000 个词, 每次 1,000 个词, 或按年计费的 $169 和 $259。
我们的测试中它的得分如何
检测结果的变化是它最强的一项表现, 而且是真实的表现。重写会强烈改变句子结构, 足以把一段文字从高度可预测区间中拉出来, 这也是此类工具中起主要作用的机制。
语法多数时候都保持干净。漏掉的问题是普通的重写损伤, 例如在拆分后留下悬空的从句, 或者在改写复数主语时出现一致性错误。
引文和关键词处于中间水平, 原因相同。由于没有针对二者的明确规则, 括号内容在某些处理后会保留, 在另一些处理中会被编辑, 而在方法部分定义的术语在整章中可能以三种不同形式返回。
学术语气是最弱的部分, 结果也源于该工具的目标用户。输出落在通用内容语体中, 从句更短, 连接词更平实, 研究者本会保留的缓和语气被删去。这适合 SEO 文章, 但不适合文献综述。仪表板的操作是粘贴, 设置, 运行, 复制, 没有参考视图, 也没有供在数周内处理整章的人使用的术语列表, 语言覆盖在常见欧洲语言上较强, 在其他语言上较弱。
StealthGPT 的替代方案
- Undetectable AI. 面向大批量通用内容, 以每月词池出售, 如果输出被标记则退款。
- Walter Writes AI. 在一套广泛的写作工具中提供多语言通用内容。
- Netus AI. 面向希望在多种工具之间共享一个信用池的内容营销人员。
- WriteHuman. 短篇通用写作, 返回一段文字的多个变体。
这四者都面向通用内容, 并且在学术工作上共享同一个缺口, 即没有针对引文, 术语或语体的明确规则。对于带有参考文献表的文档, TextPulse 是为此任务设计的工具, 而我们关于 humanizer 领域的指南 以相同标准比较了这些选项。
TextPulse 与 StealthGPT 的比较
| 比较内容 | StealthGPT | TextPulse |
|---|---|---|
| 设计用途 | 学生, SEO 写作者和文案撰写者 | 学术写作者, 论文, 稿件, 课程作业 |
| 公开的检测器证据 | Turnitin 上 98% human, GPTZero 上 95%, 各自 30 次中为 0 次检测, 另有一项如果订阅者被检测到则退款的保证 | 在一个 2,000 份文档的学术语料库上的供应商基准, Turnitin AI 为 92.33%, Originality.ai 为 89.12%, GPTZero 为 87.91% |
| 引文处理 | 其材料中未说明 | 在 APA, MLA, IEEE, Chicago, Harvard 和 Vancouver 中逐字保留 |
| 术语控制 | 其材料中未说明 | Freeze terms 锁定任何概念或仪器, 统计结果自动保留 |
| 语体 | 通用内容和 SEO 写作, 以及论文和社交帖子 | 同行评审训练数据, 保持在 Flesch-Kincaid 13 到 18 年级 |
| 每次处理容量 | Enterprise 一次最多 20,000 个词 | 整篇文档处理, 片段之间没有接缝 |
| 价格 | Pro, Samurai 和 Enterprise 层级。未说明 | Pro 每月 $19, 25,000 个词, Plus $29, 50,000 个词, 或按年计费的 $169 和 $259 |
对 StealthGPT 的结论
StealthGPT 是高批量 SEO 和文案写作工作的可信选择。退款保证是一个真实承诺, 大多数竞争者都不愿作出, 发布带有明确样本数量的数字也比该类别的常规做法更好, 而一次 20,000 个词的单次运行能为内容团队节省真实时间。如果这就是你的工作, 它是一个合理的购买工具。
对于学术文档, 使用 TextPulse。退款对已经提交的章节没有任何作用, 因此你需要的保护必须内置于重写之中。引文和参考文献条目在六种引用格式中逐字保留。Freeze terms 固定概念和仪器名称。统计结果, 效应量和公式自动保留。语体保持在 Flesch-Kincaid 13 到 18 年级区间。Pro 每月 $19, 25,000 个词, Plus 为 $29, 50,000 个词, 或按年计费的 $169 和 $259。
证据缺口也指向同一方向, 30 份文档对比一个 2,000 份文档的学术语料库, Turnitin AI 为 92.33%, Originality.ai 为 89.12%, GPTZero 为 87.91%, 两者都由供应商测量。TextPulse 在每次处理后报告一个估计的 Human Score, 并且不对你的文件在检测器上的判定作任何承诺。对于论文或稿件, 使用 academic AI humanizer, 说明所获帮助, 并在你的院系要求之处加以引用。
常见问题
它是为不同任务设计的。StealthGPT 将学生、SEO 写作者和专业文案撰写者列为受众,其语体涵盖通用内容和 SEO 写作,以及论文和社交帖子。其材料中没有任何内容说明引文处理、术语锁定或学术语体目标,而这三项保护正是论文或手稿所依赖的。对于这些文档,TextPulse 是推荐选择。
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.