AI 内容安全审查:上线前必须做的过滤
张张老师64 阅读
AI 应用上线,内容安全是绕不开的:用户可能输入违规内容,模型也可能输出不该出现的内容。不做审查,轻则被投诉,重则直接关站。这篇讲我搭建的内容审查方案。
双重审查:
1. 输入审查(用户输入)。用户发给模型的内容,先过一遍:
- 敏感词过滤(政治、色情、暴力、违法等敏感词库)
- 链接检测(可疑链接、钓鱼链接)
- 长度限制(超长输入本身可能是攻击)
2. 输出审查(模型输出)。模型生成的内容也要审:
- 同样过敏感词过滤
- 用审查模型(如 OpenAI moderation API 或开源审查模型)二次判断
- 关键场景:检测到违规输出,替换为"该内容不符合规定"或直接拦截
实现方式:
关键词过滤(便宜快,作为第一道):
Python
SENSITIVE_WORDS = [...] # 敏感词库
def check_input(text):
for w in SENSITIVE_WORDS:
if w in text:
return False
return True
模型审查(准确但贵,作为第二道):
Python
result = client.moderations.create(input=text)
if result.results[0].flagged:
reject()
组合策略:关键词先挡大部分,模型审查处理语义绕过的(比如谐音、暗示)。
坑:
-
敏感词库要维护。新词不断出现,词库要定期更新。别指望一份词库用到底。
-
误杀问题。过度过滤会误伤正常内容(比如"毒品"在医疗文章里是正常词)。策略:命中敏感词不直接封,而是标记人工审核,或者看上下文(前后词)判断。
-
审查本身要记录。被拦截的内容、时间、原因要留日志,方便申诉和复盘。
-
模型审查的成本。每次输出都调审查模型,成本叠加。策略:先关键词快速过滤,通过不了的才调模型,大部分流量走便宜通道。
-
合规要求。根据你的业务地区,内容审查标准不同(国内有明确的内容安全规范)。上生产前了解清楚当地要求。
最后:内容安全是"成本"也是"保险"。别为了省一点审查成本,把整个应用置于风险中。
评论0
还没有评论,来抢沙发~