模型服务
模型服务概述
大模型公共服务平台提供多类型模型服务,基于统一模型网关实现多模型接入与标准化调用。平台围绕不同使用场景,对模型能力进行分层组织,帮助用户根据任务复杂度、上下文长度、是否涉及图像输入、响应效率和推理质量要求选择合适模型。
当前平台重点提供以下模型能力:
- DeepSeek-V4-Flash
- Qwen3.6-35B-A3B
- Qwen3.6-27B
- DeepSeek-V4-Pro
各模型在参数规模、激活参数、上下文长度、推理能力、图文理解能力和适用场景方面各有侧重,可共同支撑从日常问答、教学辅助、长文档处理、图文理解,到复杂科研推理和高质量内容生成的多类任务。
模型分层体系
平台模型服务采用三层分工体系:
该分层综合考虑模型结构、实际激活参数、上下文长度、推理成本、并发能力、图文理解能力和适用场景,形成面向不同用户需求的模型服务体系。
① 高效通用层
定位
高效通用层面向日常问答、文本处理、长文档分析、常规图文理解和高并发 API 调用等常见场景,强调响应效率、服务稳定性和综合性价比,适合作为平台默认调用层。
代表模型
| 模型 | 参数规模 | 量化方式 | 上下文 | 能力定位 | 推荐场景 |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash | 284B(13B 激活) | FP8 | 1M | 主力通用模型 | 日常问答 / 长文本 / 高并发 |
| Qwen3.6-35B-A3B | 35B(A3B 激活) | BF16 | 262K | 高效通用 / VL 图文理解模型 | 日常问答 / 长文本 / 图文理解 / Agent 常规任务 |
DeepSeek-V4-Flash:高效“全能助手”,支撑普惠型大模型服务
核心优势:
DeepSeek-V4-Flash 采用 284B 总参数、13B 激活参数 的模型结构,支持 1M 上下文长度,在通用能力、响应效率和部署成本之间取得较好平衡,适合作为平台默认主力模型,为全校师生提供稳定、高效的大模型服务。
建议用途:
- 校园事务智能问答
- 文本生成、摘要、翻译与润色
- 文献速读与长文档总结
- 教学辅助与课程问答
- 面向全校的高并发 API 调用
- 轻量级科研辅助与办公写作
推荐场景:
Qwen3.6-35B-A3B:高效通用模型,支持图文理解与智能体应用
核心优势:
Qwen3.6-35B-A3B 采用 35B 总参数、A3B 激活参数 的结构,支持 262K 上下文长度,在模型能力、推理效率和资源消耗之间保持较好平衡。同时支持 VL(Vision-Language)图文理解能力,可处理文本、图片、截图、图表等多模态输入,适合作为高效通用型图文理解模型使用。
建议用途:
- 日常问答与文本生成
- 长文本总结与分析
- 图片、截图、图表等材料的基础理解
- 多轮对话与复杂指令执行
- 教学助手、科研助手等智能体应用
- 课程问答与实验室知识问答
- Agent / MCP 场景下的常规任务执行
- 中高并发的通用模型服务
推荐场景:
② 能力增强层
定位
能力增强层面向教学辅助、编程支持、复杂图文分析、复杂问答、结构化输出和中等复杂度科研任务,强调更稳定的任务理解、代码辅助、图文分析和多轮任务执行能力。
代表模型
| 模型 | 参数规模 | 量化方式 | 上下文 | 能力定位 | 推荐场景 |
|---|---|---|---|---|---|
| Qwen3.6-27B | 27B | BF16 | 262K | 能力增强 / VL 图文理解模型 | 教学 / 编程 / 图文分析 / 结构化输出 |
Qwen3.6-27B:能力增强模型,支持复杂图文理解、教学与代码任务
核心优势:
Qwen3.6-27B 具备 27B 参数规模,支持 262K 上下文长度,同时支持 VL(Vision-Language)图文理解能力。该模型更适合承担教学辅助、代码理解、复杂截图分析、结构化输出和中等复杂度图文任务。相比高效通用层模型,它更强调任务执行稳定性、代码与教学场景适配能力,以及复杂输入下的结构化分析能力。
建议用途:
- 程序设计课程辅助教学
- 代码解释、代码生成与调试建议
- 项目作业指导与代码审阅辅助
- 教学问答与课程智能助教
- 截图、界面、图表等图文材料分析
- 结构化文本生成
- 批量文本处理与中等复杂度任务执行
- Agent / MCP 场景下的任务执行模型
推荐场景:
③ 高阶推理层
定位
高阶推理层面向科研攻关、复杂逻辑推理、多步骤分析和高质量内容生成任务,强调推理深度、复杂问题处理能力和高质量输出。
代表模型
| 模型 | 参数规模 | 量化方式 | 上下文 | 能力定位 | 推荐场景 |
|---|---|---|---|---|---|
| DeepSeek-V4-Pro | 1.6T(49B 激活) | FP8 | 1M | 顶级推理模型 | 科研攻关 / 复杂推理 / 高质量输出 |
DeepSeek-V4-Pro:高阶“推理大脑”,专攻复杂科研任务
核心优势:
DeepSeek-V4-Pro 拥有 1.6T 总参数量、49B 激活参数,支持 1M 上下文长度,具备较强的复杂推理、长文档理解和多步骤分析能力,适合承担高复杂度科研分析与深度内容生成任务。
建议用途:
- 科研论文深度分析与综述撰写
- 基金申请书、项目申报材料辅助撰写
- 长文档、多材料联合分析
- 复杂逻辑推理与多步骤任务规划
- 高质量科研写作与学术内容生成
- 作为科研 Agent 的高阶推理模型
推荐场景:
模型能力对比
| 模型 | 所属层级 | 参数规模 | 上下文 | 能力定位 | 推荐场景 |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash | 高效通用层 | 284B(13B 激活) | 1M | 主力通用模型 | 默认调用、日常问答、长文本、高并发 |
| Qwen3.6-35B-A3B | 高效通用层 | 35B(A3B 激活) | 262K | 高效通用 / VL 图文理解模型 | 日常问答、长文本、图文理解、Agent 常规任务 |
| Qwen3.6-27B | 能力增强层 | 27B | 262K | 能力增强 / VL 图文理解模型 | 教学、编程辅助、图文分析、复杂问答、结构化输出 |
| DeepSeek-V4-Pro | 高阶推理层 | 1.6T(49B 激活) | 1M | 顶级推理模型 | 科研攻关、复杂推理、高质量输出 |
快速选型指南
如果不确定选择哪个模型,可以参考以下建议:
| 使用需求 | 推荐层级 | 推荐模型 |
|---|---|---|
| 日常问答 / 文本处理 | 高效通用层 | DeepSeek-V4-Flash / Qwen3.6-35B-A3B |
| 全校默认 API 调用 | 高效通用层 | DeepSeek-V4-Flash |
| 长文本 / 多轮任务 | 高效通用层 | DeepSeek-V4-Flash / Qwen3.6-35B-A3B |
| 常规图文理解 / 图片材料分析 | 高效通用层 | Qwen3.6-35B-A3B |
| 教学问答 / 编程辅助 | 能力增强层 | Qwen3.6-27B |
| 复杂截图分析 / 结构化图文任务 | 能力增强层 | Qwen3.6-27B |
| Agent / MCP 常规应用 | 高效通用层 / 能力增强层 | Qwen3.6-35B-A3B / Qwen3.6-27B |
| 科研分析 / 复杂推理 | 高阶推理层 | DeepSeek-V4-Pro |
| 高质量科研攻关 | 高阶推理层 | DeepSeek-V4-Pro |
使用建议
- 普通问答、写作、总结类任务:优先选择 DeepSeek-V4-Flash 或 Qwen3.6-35B-A3B。
- 长文档、多轮对话类任务:优先选择 DeepSeek-V4-Flash 或 Qwen3.6-35B-A3B。
- 图片、截图、图表等常规图文理解任务:优先选择 Qwen3.6-35B-A3B。
- 复杂截图分析、代码相关图文任务、结构化图文输出任务:优先选择 Qwen3.6-27B。
- 教学、编程、结构化输出类任务:优先选择 Qwen3.6-27B。
- 科研攻关、复杂推理、高质量内容生成类任务:优先选择 DeepSeek-V4-Pro。
- 面向全校的默认 API 服务:建议优先使用 DeepSeek-V4-Flash。
总结
平台围绕不同任务需求构建多模型协同服务体系:
- DeepSeek-V4-Flash 面向高效通用、长文本和高并发服务;
- Qwen3.6-35B-A3B 面向高效通用、图文理解、多轮任务和 Agent 常规应用;
- Qwen3.6-27B 面向教学、代码、复杂图文分析、复杂问答和结构化输出等能力增强场景;
- DeepSeek-V4-Pro 面向复杂科研推理与高质量内容生成。
用户可根据任务复杂度、上下文长度、是否涉及图像输入、响应效率和推理质量要求选择合适模型。