技术更新
本页介绍大模型公共服务平台的模型更新、接口适配、性能优化与运行维护情况,帮助师生了解服务变化及其使用影响。
更新至 2026 年 9 月 22 日 · 近期更新按日期倒序排列,早期工作按主题汇总。2026 年 9 月以前的记录由历史提交补充,未覆盖全部维护工作。
开始使用平台: 新手入门 · 查看模型与权限 · 词元成长营:智能体接入与实践
与使用有关的变化¶
| 关注点 | 已完成的更新 | 使用提示 |
|---|---|---|
| 模型服务 | 上线 DeepSeek V4.1 Flash;完成 Qwen3.8 27B 更新,并持续修复 GLM-5.3-Flash 的运行问题 | 在项目授权列表中查看可用模型,配置时复制准确的模型 ID |
| 智能体与接口 | 持续完善 Anthropic Messages、工具调用、流式输出与推理参数适配;支持按模型部署开启原生 Responses 转发 | Claude Code 可通过平台接入本地模型;Responses 的开放范围以具体模型部署和项目授权为准 |
| 响应与长文本 | 优化网关、缓存和推理调度;在支持的部署中实现 1M 词元上下文 | 上下文上限依模型和部署配置而定;实际等待时间还受输入长度、输出长度及服务负载影响 |
| 运行稳定性 | 修复请求取消、并发计数、工具参数解析及缓存相关问题;完成网关数据库与部署架构调整 | 遇到异常时,请记录发生时间、模型 ID、报错信息及请求 ID(如有),便于定位 |
客户端配置可查阅DeepSeek Harness 接入指南和Claude Code 接入指南。
2026 年 9 月:近期更新¶
9 月 22 日 · 修复 GLM 输出异常¶
修复 GLM-5.3-Flash 在张量并行(TP)运行时输出错乱的问题。调整序列并行 MoE 场景下前三层 Dense FFN 的分配方式,由错误分片改为复制。
9 月 21 日 · 优化 DeepSeek 缓存与推理¶
- 合并上游针对 DeepSeek V4.1 Flash 的优化,部署并验证 Mooncake Store,提升缓存命中效果。缓存命中可复用已计算的上下文,减少重复计算。
- 修复 GLM-5.3-Flash 中索引信息未正确传递导致的多词元预测(MTP)越界访存问题。
9 月 20 日 · 恢复节点互联,更新推理引擎¶
排查 GLM-5.3-Flash 性能问题时发现两个节点存在高速网络适配器(HCA)离线,已恢复上线。同步更新 vLLM 并迁移平台适配修改。
9 月 19 日 · 完善昇腾分离部署适配¶
修复昇腾预填充与生成分离(PD 分离)部署中的缓存传输协议适配问题,将 Mooncake 连接地址解析前移至请求建立阶段,避免完成输入处理后才报告地址错误。
9 月 17 日 · 优化网关架构¶
网关数据库迁移至独立服务器和高速存储;网关管理平面与数据平面分离部署,优化服务性能。
9 月 16 日 · 修复并发槽位释放¶
修复请求结束后并发槽位未被正确释放的问题,覆盖请求成功、失败、流式连接拆除和取消等路径,避免已结束的请求继续占用并发名额。
9 月 13 日 · 数据库故障恢复¶
网关数据库主机故障及主从切换后的复制异常造成约 3 小时服务中断。完成数据备份、主库恢复和从库重建后,服务恢复。9 月 17 日进一步完成数据库迁移及网关架构调整。
9 月 12 日 · 完善缓存元数据接口¶
恢复 vLLM EngineCore 的 KV 缓存分组元数据接口,供 Dynamo 路由和缓存管理组件识别缓存分组。
9 月 11 日 · 上线 DeepSeek V4.1 Flash¶
完成 DeepSeek V4.1 Flash 发布当日接入。优化模型 engram 表在 NUMA 节点内的主机内存共享方式,降低内存占用,并保持并行隔离和 CUDA graph 指针稳定。
9 月 10 日 · 定位首词元延迟,完善新模型适配¶
- 针对首词元等待时间(TTFT)较长的问题,在网关启用 OpenTelemetry 性能追踪,定位认证阶段的数据库瓶颈;扩大内存缓冲区以缓解存储压力。
- 请求计数改用独立数据库连接,并在后台批量写入;合并重复的花费查询,减少主请求处理路径中的数据库操作。
- 完善 DeepSeek V4.1 Flash 的工具调用格式解析、推理与流式输出处理,以及数字推理预算和
xhigh参数传递。
9 月 8 日 · 调整工具调用解析与监控¶
回退过度清理 DSML 工具标记的处理,避免误删正常正文,同时保留按请求声明的工具进行校验。扩展缓存连接器支持,并增加优先级暂停与缓存等待的监控指标。
9 月 1—4 日 · 完善优先级调度¶
网关和推理引擎引入并持续调整优先级策略,优先保障智慧校园应用。推理调度逐步调整为优先生成阶段,高优先级输入处理可暂停低优先级输入处理;暂停时保留已有缓存,仅在缓存压力下回收,减少重复计算开销。
2026 年 8 月:兼容性与性能优化¶
模型与部署¶
- 8 月 30 日:
deepseek-v4-flash-ascend与 Qwen3.8 27B 调整为 PD 分离部署,完善昇腾平台缓存传输适配。 - 8 月 14 日: Qwen3.6 27B 更新为 Qwen3.8 27B。
- 8 月 3 日: 昇腾平台 DeepSeek V4 Flash 更新至 DeepSeek-V4-Flash-0731;对应非昇腾版本已于 7 月 31 日更新。
智能体与接口¶
- 8 月 20—22 日: 修复 DeepSeek 工具调用标记混入正文的问题,并按请求声明的工具校验解析结果。相关清理逻辑在 9 月 8 日进一步调整,以保留正常文本。
- 8 月 16 日: 保留工具调用参数中的原始前导空白,避免文件编辑等操作中的代码缩进被删除。
- 8 月 15 日: 修复 Qwen 多轮工具调用中参数退化为空的问题,调整服务端模板渲染判据。
- 8 月 6 日: 修复正文包含字面文本
[DONE]时流式响应被误截断的问题。 - 8 月 5 日: 支持按部署配置启用原生
/v1/responses转发;完善推理强度与 Anthropic 提醒信息的处理。 - 8 月 1 日: 修复重排序(rerank)请求用量未计入花费日志,以及部分非 DeepSeek 模型推理参数被错误归一化的问题。
长上下文与推理稳定性¶
- 8 月 25 日: 修复 DeepSeek V4 在部分长前缀缓存续写场景下读取上下文不完整、导致输出错乱的问题,通过 84k 词元长文本检索探针验证。
- 8 月 19 日、28 日: 修复认证状态刷新、推理元数据映射及 GLM-5.3-Flash 长输入处理中的异常,减少引擎崩溃和越界访存。
- 8 月 17 日: 优化 SM90 架构上的 MQA 计算并启用 DSpark 动态验证长度。在该项测试环境中,DeepSeek-V4-Flash 吞吐提升 10%—13%;该结果对应特定硬件与优化配置,不代表所有模型或请求的固定增幅。相关代码
更早的主要更新¶
2026 年 7 月 · 推理稳定性与连接管理¶
修复缓存传输、并行推理、投机解码及流式工具调用解析中的多项异常。完善客户端断连后的上游连接关闭,修复网关并发计数漂移;统一 Anthropic 端点支持配置,并修复 DeepSeek Anthropic 风格透传的地址与认证适配。持续更新 Dynamo、vLLM 和 LiteLLM,保留平台所需的适配修改。
2026 年 6 月 · 长上下文、模型权限与预算¶
- 长上下文: 6 月 22 日将 DSA 的解码上下文并行(DCP)及 FP8 KV 缓存支持上线生产,在相关部署中支撑 1M 词元上下文,并向 vLLM 提交上游改进。
- 模型可见范围: 6 月 18 日调整
/v1/models与/model/info的模型枚举,按密钥和团队权限过滤;普通密钥仅能查看其获准访问的模型。 - 预算与日志: 修复窗口化预算配置保存、预算周期重置以及 Anthropic 请求用量日志处理问题。
- 输出与取消: 持续完善 DeepSeek 推理控制、工具调用参数解析及断连后的请求取消处理。
2026 年 4—5 月 · 协议适配与昇腾支持¶
完善 Anthropic /v1/messages、thinking 与 reasoning_effort 适配,支持将 Anthropic 风格请求透传至 OpenAI 兼容后端;维护 Dynamo 与 vLLM 平台分支,推进昇腾构建、缓存事件和元数据接口适配,并持续更新推理组件。
2025 年 11—12 月 · 网关基础维护¶
增加按密钥元数据设置请求优先级的能力,修复 Redis Sentinel 认证参数传递,更新 LiteLLM 并完善容器进程管理。
技术名词速查¶
| 名词 | 通俗解释 |
|---|---|
| 词元(Token) | 模型处理文字的基本单位,与汉字或单词并不一一对应 |
| 首词元等待时间(TTFT) | 从发出请求到收到第一个输出词元所经历的时间 |
| KV 缓存、前缀缓存 | 保存并复用已计算的上下文信息,减少重复计算;缓存命中不表示直接复用整段答案 |
| PD 分离 | 将读取和处理输入的阶段(Prefill)与逐步生成回答的阶段(Decode)分开部署 |
| 工具调用 | 模型生成结构化的操作请求,由智能体按授权执行,例如读取文件或运行程序 |
| 推理强度 / 推理预算 | 调节模型推理过程的参数;支持的取值和实际行为依模型而定 |
| 吞吐量 | 系统在单位时间内处理的工作量,不等同于单个请求的响应速度 |
记录来源与延伸阅读¶
本页依据平台技术工作记录整理,保留主要日期、能力范围与故障恢复信息。更细的工程记录请参阅原文;模型使用方法见模型服务和API 使用,智能体配置与实践见词元成长营。