Mistral发布3B多模态审核模型,更改一句Prompt即可更换规则
据 动察 Beating 监测,欧洲 AI 独角兽 Mistral 推出内容审核模型 Shieldstral。模型只有 30 亿参数,可以检查文字、图片和图文内容,也能判断 AI 是否应该拒绝回答。
不少传统审核模型会预先设定色情、暴力、仇恨等类别。审核标准变化后,通常需要补充数据,再训练或微调模型。
Shieldstral 可以直接读取自然语言规则。开发者改一下审核要求,就能换一套标准,不必重新训练模型。
模型支持中文等 12 种语言,采用 Apache 2.0 许可。官方称,单张 16GB 显存的英伟达显卡即可运行,文本审核成绩与参数量大约 7 倍的 GPT-OSS-Safeguard-20B 持平。