先定响应式断点,再谈视觉
以 380 / 640 / 1024 / 1600px 四档为基线,容器宽度 1140→1400→1680px 逐级放宽。卡片网格用 minmax(0,1fr),避免长英文 token 名撑破列宽。
横向溢出率目标 0面向开发者、创业者与科技爱好者的 AI 平台底座:以冷色系设计承载动态交互,用模块化布局把「模型接入 → 编排 → 观测 → 上线」压缩进一条可度量的流水线,让差异化不再靠堆功能,而靠工程节奏。
每条都给出阈值与做法,直接复用到你的 AI 平台前端与推理链路。
以 380 / 640 / 1024 / 1600px 四档为基线,容器宽度 1140→1400→1680px 逐级放宽。卡片网格用 minmax(0,1fr),避免长英文 token 名撑破列宽。
横向溢出率目标 0深底页面正文与背景对比度 ≥ 7:1,辅助文字 ≥ 4.5:1。强调色只用于按钮、激活态与关键数字,占用面积控制在整屏 10% 以内。
WCAG AA 起步弹入/缩放动画时长 250–450ms、缓动 cubic-bezier(.16,1,.3,1);在 prefers-reduced-motion 下统一压到 0.001ms,避免眩晕与低端机掉帧。
首屏动效 ≤ 4 处首个 token 返回超过 800ms 即显示骨架与进度提示;超过 8s 自动切换备用模型路由,并在界面标注已降级,避免用户误判卡死。
TTFT ≤ 800ms每个模型调用记录 token 数与耗时,按日聚合。当单次请求成本上浮 20% 或 P95 延迟上浮 30% 时触发告警,先查缓存命中率再看路由策略。
缓存命中 ≥ 35%玻璃质感层级不超过 2 层,backdrop-filter 必须同时写 -webkit- 前缀;发光描边只出现在 1px 边框或焦点态,避免整页霓虹堆叠。
同时兼容 Safari / iOS「我们把三个自研模型和两个外部模型收敛到同一套路由后,灰度发布从两天缩短到 40 分钟,回滚只要点一次。」
「冷色系看板把 P95 延迟和 Token 成本放在同一屏,我们第一次能说清楚‘贵在哪、慢在哪’。」
「文档从接入到跑通只花了 12 分钟,SDK 的错误码给出了明确的修复建议,不用去翻论坛。」
每一步都留好验收口径,避免「能跑」与「能上线」之间出现断层。
录入模型版本、上下文窗口与单价,设置每分钟请求上限与单用户日预算。
验收:配额越界返回 429 并带重置时间用可视化 DAG 串联检索、重排、生成与校验节点,每个节点支持单独重试。
验收:单节点失败不影响已完成的缓存结果按峰值 1.5 倍流量压测,采样记录延迟、错误率与 token 消耗,形成基线。
验收:P95 ≤ 1.2s,错误率 < 0.5%先放 5% 流量观察 30 分钟,指标平稳再逐级放量到 100%,异常自动回退。
验收:回滚耗时 < 60s
统一接入自研与第三方模型,按延迟、成本、质量三维度自动路由,支持失败自动切换与结果缓存复用。
同一套模块化布局在 1680px 宽屏与 320px 窄屏之间保持信息层级一致:宽屏 4 列看板、窄屏单列堆叠,长参数名自动断行,任何视口都不出现横向滚动。
把首 token 时间、错误码解释、配额余量前置到界面首屏,减少开发者往返查文档的次数,接入首次成功率提升到 96%。
流式输出、骨架屏与运行看板实时联动;P95 延迟或单次成本越界即告警,支持按模型、租户、接口三个维度下钻。