提示注入防护规则集升级到 v4
新增 63 条检测模式,覆盖角色扮演绕过与多轮上下文投毒;对高风险请求默认降级为只读回答,误报率控制在 1.8% 以内。
面向 AI 开发平台的一体化可信工作台:模型沙箱、数据分级、调用审计三线并行。赛博朋克式的沉浸式体验之下,每一次推理都可追溯到具体密钥、具体节点、具体时刻。
把「安全与可信」拆成可读指标:策略命中、越权尝试、密钥轮换、模型漂移四项同时上墙,异常在 5 秒内着色告警。
平台侧的安全能力更新、合规基线调整与开发者社区实践,全部按可核验来源发布。
新增 63 条检测模式,覆盖角色扮演绕过与多轮上下文投毒;对高风险请求默认降级为只读回答,误报率控制在 1.8% 以内。
为生成内容嵌入不可见标识,支持按租户批量核验来源;单条核验耗时约 240ms,可用于内容合规抽检与二次分发审计。
提供 12 类对抗样本与 4 组基线指标,社区提交的防护方案可直接在同一标准下横向对比,复现实验仅需 3 条命令。
从密钥签发到结果回传,AI 开发平台把可信链路拆成四段可观测节点,任何一段缺失都会阻断放行。
赛博朋克式的未来感设计只是外壳,真正决定平台能否被企业采用的是审计闭环。以下参数为默认基线,可在租户级覆盖。
按顺序执行,每步给出可验收的量化门槛;跳步会直接导致审计链不完整。
把训练与推理数据按敏感度划成 1–6 级,5 级以上禁止出私有网络。验收标准:分级覆盖率 ≥ 98%,未分级字段数为 0。
每个服务单独签发密钥,作用域只给必需的端点;设置 rotation=14d 与 max_uses 上限。验收标准:长期密钥数量为 0,过期告警提前 72 小时。
对用户输入做长度上限(建议 8k token)与结构校验,拒绝嵌套系统指令;开启提示注入检测。验收标准:注入样本拦截率 ≥ 95%,误报 ≤ 2%。
对模型输出做敏感词、实体与格式三重检查,命中即脱敏或转人工;高风险场景强制加装内容水印。验收标准:外泄拦截率 100%,水印可核验率 ≥ 99%。
为每次调用生成唯一请求 ID,串联密钥、策略快照、模型版本与输出哈希。验收标准:日志落盘延迟 < 2s,留存 ≥ 180 天,检索响应 < 3s。
当策略服务不可用时切到只读白名单模式,禁止静默放行;设置错误率阈值 5% 触发熔断。验收标准:故障演练恢复时间 < 90s。
固定看越权、注入、漂移、密钥四组数据,波动超过基线 20% 即回溯。验收标准:每周输出一份可复现的复盘记录与整改项。
六项能力围绕「可信」展开,每项都给出可直接测量的落地指标,避免停留在概念层。

模型与工具调用在独立沙箱内执行,网络出站默认拒绝,白名单按需开通;单租户资源上限可配,防止跨租户干扰。

以声明式规则描述角色、端点与数据级别的组合约束,策略热更新 1.2s 内生效,无需重启服务即可完成灰度收紧。

支持按租户、模型、时段三维下钻,异常自动着色并推送;看板刷新周期 5s,历史趋势可回溯 180 天。

为每次发布记录版本指纹与评测基线,输出分布偏移超过阈值即告警;灰度发布支持按 5% 流量逐级放量。

密钥集中托管、自动轮换,支持按请求 ID、密钥指纹、时间区间检索;审计记录写入即不可篡改,删除需双人审批。

主题、告警阈值与工作流可租户级定制;社区共享的策略模板需通过签名校验后方可导入,降低误配风险。
联合云基础设施、安全合规与开发者社区三方,形成可交叉验证的可信生态。
开发者最关心的接入边界、性能与合规问题,逐条给出可执行答案。
本地策略判定默认在 38ms 内返回,云端复核仅在命中高风险时触发,最长 800ms 兜底。若你的 P95 延迟预算低于 50ms,建议把复核策略改为异步模式。
5 级以上数据默认禁止出私网。确需外发时走审批通道:脱敏 → 加白名单 → 限期授权,最长 72 小时自动回收,并强制记录访问人与用途。
每条日志写入时生成哈希并链式引用上一条,租户可定期导出校验;平台提供核验工具,可离线验证任意时间区间的完整性。
可以,但需先通过签名校验与静态检查。建议在沙箱中以只读模式试运行 24 小时,对比误报率后再正式启用。
直接启用平台内置的「可信基线」预设:包含 7 步接入清单中的默认参数与告警阈值,每周自动生成复盘摘要,人工只需处理被标记的高风险项。