AI 内容安全审查:上线前必须做的过滤

张老师64 阅读

AI 应用上线,内容安全是绕不开的:用户可能输入违规内容,模型也可能输出不该出现的内容。不做审查,轻则被投诉,重则直接关站。这篇讲我搭建的内容审查方案。

双重审查

1. 输入审查(用户输入)。用户发给模型的内容,先过一遍:

  • 敏感词过滤(政治、色情、暴力、违法等敏感词库)
  • 链接检测(可疑链接、钓鱼链接)
  • 长度限制(超长输入本身可能是攻击)

2. 输出审查(模型输出)。模型生成的内容也要审:

  • 同样过敏感词过滤
  • 用审查模型(如 OpenAI moderation API 或开源审查模型)二次判断
  • 关键场景:检测到违规输出,替换为"该内容不符合规定"或直接拦截

实现方式

关键词过滤(便宜快,作为第一道):

Python
SENSITIVE_WORDS = [...] # 敏感词库 def check_input(text): for w in SENSITIVE_WORDS: if w in text: return False return True

模型审查(准确但贵,作为第二道):

Python
result = client.moderations.create(input=text) if result.results[0].flagged: reject()

组合策略:关键词先挡大部分,模型审查处理语义绕过的(比如谐音、暗示)。

  1. 敏感词库要维护。新词不断出现,词库要定期更新。别指望一份词库用到底。

  2. 误杀问题。过度过滤会误伤正常内容(比如"毒品"在医疗文章里是正常词)。策略:命中敏感词不直接封,而是标记人工审核,或者看上下文(前后词)判断。

  3. 审查本身要记录。被拦截的内容、时间、原因要留日志,方便申诉和复盘。

  4. 模型审查的成本。每次输出都调审查模型,成本叠加。策略:先关键词快速过滤,通过不了的才调模型,大部分流量走便宜通道。

  5. 合规要求。根据你的业务地区,内容审查标准不同(国内有明确的内容安全规范)。上生产前了解清楚当地要求。

最后:内容安全是"成本"也是"保险"。别为了省一点审查成本,把整个应用置于风险中。

评论0

还没有评论,来抢沙发~