Shieldstral – Mistral AI 开源的多模态内容安全分类模型AI工具2小时前发布AI小集02Shieldstral是什么Shieldstral 是 Mistral AI 推出的 3B 参数开源多模态内容安全分类模型,基于Ministral-3B构建。模型将传统固定类别的内容审核重新定义为二元问答任务,支持通过自然语言查询实时定义审核策略,无需重新训练即可适配不同场景。模型在文本安全基准上平均 F1 达 84.9%,多模态安全 F1 达 83.8% 均为 SOTA,且仅需单张 16GB GPU 可部署,支持 12 种语言。Shieldstral的主要功能策略自适应审核:将安全政策以自然语言问题形式输入,实现不同场景下的实时定制化审核。多模态统一检测:单一接口同时处理纯文本、图像及图文混合内容的安全评估。细粒度违规识别:支持从粗粒度二元判断到 73 个叶类别的精细安全分类。校准安全评分:通过 softmax 归一化输出 0–1 区间的连续安全分数,以 0.5 阈值判定违规。轻量端侧部署:3B 参数规模可在单张 16GB NVIDIA GPU 上高效推理,降低硬件门槛。Shieldstral的技术原理二元问答架构:将审核任务转化为对 “yes” 与 “no” 两个输出词元的逻辑值预测,经 softmax 归一化得到连续安全分数。三字段结构化输入:采用(评估场景与严格度)、(是/否安全问题)、(待审核内容)的标准化提示格式。大规模对比训练:基于 5410 万样本(4520 万开源文本、440 万合成对比文本、450 万多模态),通过同内容异查询的对比配对训练模型区分相似类别的能力。合成数据增强:利用 LLM 将安全文本改写为违规变体,并自动生成目标类别与兄弟类别的对比查询对,强化细粒度判别。LoRA 微调 + SLERP 合并:对 Ministral-3B 进行 LoRA 高效微调,并通过球面线性插值合并公共数据集与合成数据训练的两个互补检查点。微信关注回复“开源”,加入AI开源项目交流群如何使用Shieldstral环境准备:在单张 16GB NVIDIA GPU 上部署 Shieldstral 模型及推理框架。定义审核策略:编写字段说明评估场景、领域背景与严格程度标准。编写安全查询:构造字段中的二元是/否问题,例如”内容是否宣扬身体暴力?”。输入待审内容:将文本、图像或图文组合填入字段提交模型。获取安全判定:读取模型输出的 softmax 归一化连续分数,按业务需求设定阈值进行二元违规判定。Shieldstral的核心优势策略灵活:审核标准通过自然语言实时定义,无需针对新场景重新训练模型。性能领先:3B 参数在文本和多模态安全基准上均达到 SOTA,媲美 7 倍规模模型。硬件友好:单张 16GB GPU 即可运行,显著降低企业私有化部署门槛。数据统一:通过指令-查询-文档格式整合 54.1M 异构数据,覆盖 12 种语言与多元场景。决策可解释:输出校准后的连续分数而非黑盒分类标签,便于运营人员按需调整阈值。Shieldstral的项目地址项目官网:https://mistral.ai/news/shieldstral/HuggingFace模型库:https://huggingface.co/mistralai/Shieldstral-1.0-3BarXiv技术论文:https://arxiv.org/pdf/2607.25857Shieldstral的同类竞品对比维度Shieldstral (3B)OmniGuard (7B)参数规模30 亿70 亿开源许可Apache 2.0偏商业策略自适应支持自然语言查询实时定义固定分类体系多模态 F183.8%77.6%部署门槛单张 16GB GPU更高算力需求核心差异审核政策外置为可配置查询类别固化于模型权重Shieldstral的应用场景社交平台内容风控:实时审核用户发布的图文帖子,动态适配不同社区的合规规范。AI 对话安全防护:检测用户提示词中的越狱攻击与模型输出的有害、偏见回复。广告与营销合规:自动筛查广告素材中的违规图文元素,确保跨平台投放内容合法。在线教育内容过滤:识别课程资料与互动中的不当信息,保护未成年人的学习环境。企业文档安全审计:对内部共享的多语言文件进行自动化敏感信息与违规内容检测。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇MAGI-2-preview - Sand.ai 开源的多模态视频生成模型下一篇Get3W - AI 模型聚合平台,统一接口自由切换模型相关文章QUIZGECKO – AI学习工具,自动生成多种类型的测验问题AI小集2ChatPs – AI Photoshop 插件,通过聊天方式进行图像编辑AI小集3LSP(Language Self-Play) – Meta推出的强化学习方法AI小集3Higgsfield – AI视频生成平台,提供专业电影节级相机控制能力AI小集8Wavtool – AI驱动基于浏览器的在线音乐创作平台AI小集2Ideogram Canvas – Ideogram推出的AI创意画布工具AI小集3暂无评论再想想发表评论暂无评论…热门工具LoomyLibTV绘蛙AIAiPPT秘塔AI搜索蛙蛙写作堆友Agent美图设计室Sekoupdream秒哒办公小浣熊最新收录青虎AI妙呀纳逗Pro图改改AstraFlow星图不繁简历最新文章秒悟Meoo – 1分钟生成前后端完整的网站,真0门槛开发!1小时前Get3W – AI 模型聚合平台,统一接口自由切换模型1小时前MAGI-2-preview – Sand.ai 开源的多模态视频生成模型2小时前SeedRealtime – 字节跳动推出的原生音视频全双工大模型2小时前JoyAI-Video-Edit – 京东开源的实时流式视频编辑模型2小时前Hy ASR 3.0 preview – 腾讯混元推出的新一代语音识别模型9小时前Qwen-CUA – 阿里 Qwen 等推出的原生 Computer Use Agent10小时前MemHarness – 上海 AI Lab 等推出的智能体记忆重构框架10小时前ForgeStencil – 面壁智能推出的 Stencil 全自动研究部署系统1天前Orchard – 微软研究院开源的 Agentic AI 建模框架1天前E-Bench – 腾讯混元等推出的智能体评测基准1天前SenseNova U1.5-Lite-Preview – 商汤开源的轻量多模态模型2天前Polar – AI 浏览器,自动跨站收集整合信息2天前GenOffice – Genspark 推出的本地 AI Office 客户端2天前Qwen 3.8-Max – 阿里云 Qwen 团队推出的旗舰大模型2天前