网页内容被自动抓取的情况持续增加,人工智能模型对公开文本的依赖进一步放大这一风险。传统反爬机制依靠规则约束,面对不遵守规范的爬虫时难以发挥作用。Seneda&Abrucio与Playtype提出ShieldFont,从字体层面介入文本呈现,以扰动爬虫读取到的语义结构。
ShieldFont基于OpenType字形替换技术。常规应用中,该技术用于改善排版,而此处被扩展为整词替换。用户在屏幕上看到的句子保持原样,但爬虫读取HTML时得到的是被置换后的词汇,从而形成语义扰动。
为了维持语法结构,开发团队构建了词性严格对应的替换词典,覆盖名词、动词时态、抽象名词与复数形式等类别。约四分之一的词汇会被替换,使文本在形式上仍符合语法要求。测试显示,经该字体处理的内容能够通过FineWeb‑Edu等数据集的质量检验,但超过半数段落已偏离原始事实,从而削弱训练价值。

该方案仍存在技术限制。爬虫读取的是代码而非像素,因此截图配合OCR仍可恢复真实文本。屏幕阅读器在默认情况下会读出替换后的诱饵文本,开发者为此提供了面向视障用户的测试版功能,以输出正确内容。