A重点74
Mistral AI Blog
1 个来源Shieldstral 推出 3B 多模态安全分类器
Shieldstral 发布了一款 3B 参数的开源多模态安全分类器,其性能优于体积高达其 7 倍的模型。该发布旨在为 AI 安全提供更高效、可访问的工具。
Shieldstral 发布了一款 3B 参数的开源多模态安全分类器,其性能优于体积高达其 7 倍的模型。该发布旨在为 AI 安全提供更高效、可访问的工具。
SynthePulse Insight · AI 深度解读会员精读
版本 1 · 1 个来源
Mistral AI 发布 Shieldstral,一个 3B 参数的开源多模态安全分类器。它把内容审核重新定义为策略自适应的问答任务,在推理时接受自然语言政策,无需重新训练即可适配新场景,并在文本安全等基准上匹配甚至超越高达 7 倍体量的模型。
Shieldstral 的核心创新在于将内容审核重新定义为二元问答任务。每个请求包含三个部分:<Instruct> 提供评估上下文和严格程度,<Query> 是一个明确的 yes/no 问题(例如“该内容是否宣扬身体暴力?”),<Document> 则是待审核的内容,可以是提示词、回复、提示词-回复对,或带可选文本的图像。
推理时,模型仅读取 yes 和 no 的 logits,并通过 softmax 归一化为连续的安全分数。这种设计统一了提示词分类、回复审核、拒绝检测和毒性检测,使政策完全存在于提示词中,一个检查点即可在部署时适应新政策,无需重新训练。
本报道基于 Mistral AI 官方博客的新闻稿,属于第一方来源。所有性能声明(如“匹配或超越 7 倍体量模型”)均来自官方,未经独立验证。基准测试的具体数据集和结果细节未在来源中提供,因此无法独立核实。
主报道
主报道来源