数据出境与泄密风险
企业文档、客户信息、业务数据送入公有云模型,链路不可审计、不可追溯,一旦泄密代价不可控。
AI 能力,应当部署在企业自己的机房里——而不是放在别人的数据中心里。
01公有云大模型很强,但企业核心业务场景要的往往不是"最强模型",而是"数据可控、成本可算、合规可过"的私有化算力。
企业文档、客户信息、业务数据送入公有云模型,链路不可审计、不可追溯,一旦泄密代价不可控。
API 按 token 计费,调用越多越贵;模型升级、并发增长后,三年成本远超一次私有化建设。
金融、政务、央国企等场景对国产化、自主可控、等保合规有明确验收要求,商用 GPU 难以落地。
模型、向量库、Agent 与业务系统分散在不同环境,无法在同一受控网络内闭环与调优。
统一基于海光 CPU + K100-AI DCU 全栈架构,型号与规格可按业务场景定制。
1 × K100-AI · 64GB 显存 · 单机承载 72B 模型
含硬件 + 部署调优,渠道价随行情波动
2 × K100-AI · 128GB 显存 · 多应用并行
含硬件 + 部署调优,渠道价随行情波动
8 × K100-AI · 512GB 显存 · 训练微调
含硬件 + 部署调优,渠道价随行情波动
同一平台族,三档算力密度。从单卡到八卡,CPU、内存、存储、电源按负载规格逐级放大,迁移路径清晰。
| 配置项 | HS-S1 入门单卡 | HS-M2 主流双卡 | HS-H8 高端八卡 |
|---|---|---|---|
| AI 加速卡 | 1 × 海光 K100-AI64GB HBM2 · 896GB/s · FP16 192 TFLOPS | 2 × 海光 K100-AI128GB 总显存 · 推理高并发 | 8 × 海光 K100-AI512GB 总显存 · 支持 671B 级模型 |
| CPU | 海光 7000 系列单路/双路 · 最高 64 核 128 线程 | 双路 海光 7480/749064 核 × 2 · DDR5 内存通道 | 双路 海光 749064 核 × 2 · 400W TDP 旗舰 |
| 内存 | 128GB DDR4/DDR5 ECC可扩展至 256GB | 256GB DDR5 ECC可扩展至 512GB | 512GB–1TB DDR5 ECC满足多实例与微调 |
| 存储 | 2 × 960GB NVMe系统 + 模型分区 | 2 × 1.92TB NVMe模型 + 向量库 | 4 × 3.84TB NVMe多模型库 + 数据集 |
| 电源 | 1600W 1+1 冗余单卡满载约 1.5kW | 2700W 3+1 冗余双卡满载约 2.5kW | 3200W 3+1 / 2+2 冗余八卡满载约 6.5–8kW |
| 形态 | 2U 机架 / 塔式风冷,普通机房可部署 | 2U 机架风冷,双卡直连 | 4U 机架八卡高密度 · 前后维护 |
| 模型承载 | 72B INT4 · 32B 并发Qwen / DeepSeek 开源系 | 72B INT8 · 多模型共存72B + 32B + 向量 | 671B INT4 · 训练微调DeepSeek-V3 · LoRA |
| 参考价 | ¥18–25 万渠道参考(2026-09) | ¥35–45 万渠道参考(2026-09) | ¥75–95 万渠道参考(2026-09) |
* 价格为渠道参考区间,随供需与汇率波动;实际以采购询价为准。显存占用口径:72B INT4≈48GB / INT8≈80GB / FP16≈144GB;DeepSeek-V3 671B INT4≈200GB;32B INT4≈22GB。
计算与加速同源同厂——x86 兼容 CPU 负责调度与数据通路,K100-AI DCU 负责大模型推理与训练,避免异构平台间的适配损耗。
72B 级模型单卡可载:K100-AI 64GB 显存直接承载 Qwen3-72B / DeepSeek-R1-70B INT4 量化推理,中小规模团队一台入门机即可上线,无需凑卡。

服务器长期稳定,供电是地基。本方案的平台供电按企业级满载工况设计,全链路可遥测、可封顶、可演进。
海光 7000 系列 CPU 平台供电按 每路 10–12 相 规划,功率级选用 90A 级 DrMOS(英飞凌 / MPS 方案),搭配数字 VR 控制器,双路满载供电余量充足,长期负载率控制在额定 60% 以内,为可靠性留足裕度。
VR 控制器支持 PMBus/SMBus 遥测,电压、电流、温度、功耗实时上送;支持功耗封顶(Power Capping)与动态调压,BMC 可带外读取全链路供电健康状态。
K100-AI 额定 350W,PCIe 插槽仅提供 75W,其余功耗由 12VHPWR 16-pin 外接供电 补充(线材按卡数配齐)。卡载独立 VRM 完成板级供电,整机只需保证 PSU 容量与 12V 分配。
平台搭载企业级 BMC(IPMI/Redfish),支持远程开关机、固件升级、硬件健康监控与告警;可选国产 BMC 方案,满足信创管理链路的全自主要求。
平台供电架构预留 TLVR(跨电感稳压器)+ Dual SPS(双芯合封功率级)演进路径——该组合方案可显著提升电源转换密度与瞬态响应,为下一代更高功耗的 DCU 芯片供电做好准备,现有投资可平滑升级。
以下是主流开源模型在不同量化精度下的显存占用与推荐档位(INT4 为 4-bit 量化,INT8 为 8-bit 量化,FP16 为半精度)。显存是私有化部署的第一约束,选对档位即可一机到位。
海光 DCU 采用类 CUDA/HIP 的编程模型,主流推理框架与开源模型均可直接适配,企业已有代码与团队技能可平滑过渡。
海光官方开发者工具包,类 CUDA 编程接口与编译器,支持 CUDA 代码迁移,迁移成本在国产芯片方案中最低。
主流高性能推理引擎原生支持,提供高吞吐、低延迟的在线推理服务与 OpenAI 兼容 API。
Qwen、DeepSeek 等主流开源模型开箱适配,支持 LoRA 微调、权重转换与私有模型部署。
兼容麒麟、统信 UOS 等国产操作系统,亦支持主流 Linux 发行版,与既有 IT 体系无缝衔接。
生态完整度说明:K100-AI 已规模化出货、供应稳定,推理生态覆盖主流框架;实际性能以 POC 实测为准,交付前我们会用目标模型做一轮基准验证。
同一套软件栈,起步一台入门机,业务增长后按节点扩容,不推翻重来。

HS-S1 / HS-M2 一台到位:模型 + 向量库 + 业务服务同机运行,办公室或机房均可部署,当天上线。
HS-M2 双机主备 + 共享存储,业务连续性有保障,适合对稳定性要求高的生产环境。
HS-H8 多台组成算力池:负载均衡、多租户隔离、集中存储与监控,支撑全公司级算力运营。
可与企业现有 OA/IM/业务系统打通,与 Owlfy 私有化 Agent 套件协同,形成数据闭环。
按中型团队日调用量估算,云 API 三年费用远高于私有化一次性建设;模型与数据沉淀在本地,边际成本趋于零。
含硬件、电费与维保;云侧按 72B 级模型日均百万 token 估算,3 年线性累计。
多应用高并发场景;数据本地留存,无 token 计费、无传输损耗。
覆盖训练微调与多租户推理;算力资产可折旧、可复用、可对外运营。
* 电费按 0.6 元/kWh、7×24 运行估算:S1 满载约 1.5kW(≈1.3 万元/年)、M2 满载约 2.5kW(≈1.8 万元/年)、H8 满载约 6.5–8kW(≈4.2 万元/年)。云侧估算基于公开 API 定价区间与典型用量,仅供参考;实际成本以项目级报价与用量核算为准。
面向信创验收与数据安全要求设计,全链路可解释、可审计。
模型与数据全部落在企业物理机内,推理链路不经过任何外部网络,满足数据本地化与保密要求。
国产 CPU + 国产 DCU + 可选国产 OS/BMC/中间件,整机满足信创目录与国产化率验收要求。
海光 DCU 未被列入出口管制实体清单,芯片供应与量产节奏稳定,不受海外政策波动影响。
多租户权限隔离、操作日志、模型访问审计,满足企业内部数据治理与安全合规检查。
从 POC 验证到长期运营,覆盖硬件维保、软件升级与模型迭代的完整服务链。
预装系统与推理栈,到货即用;工程师现场/远程完成部署与业务接入。
针对目标模型做量化、并行、显存与吞吐调优,输出基准测试报告。
远程监控 + 季度巡检 + 备件保障,硬件故障快速响应,业务不中断。
新模型发布后的适配与升级、LoRA 微调支持、扩容规划建议。

标准交付路径,每个阶段有明确的输入与产出,随时可查进度。
目标模型基准测试,验证吞吐、延迟与显存,确定档位与配置。
整机下单、出厂质检与预装系统,交付周期以商务为准。
上架、组网、推理栈部署、量化与并发调优,输出性能报告。
对接知识库、业务系统与 Agent,联调测试并灰度上线。
监控、巡检、模型升级与扩容规划,随业务增长平滑演进。
海光是国内唯一拥有 x86 永久授权的国产芯片厂商,CPU 与 DCU 全栈自研;DCU 采用类 CUDA/HIP 架构,企业现有模型与代码迁移成本在国产方案中最低;K100-AI 单卡 64GB 显存即可承载 72B 级模型,且量产供应稳定、未被列入出口管制实体清单。
支持 Qwen、DeepSeek 等主流开源模型系。Qwen3-72B / DeepSeek-R1-70B 单卡 INT4 运行;DeepSeek-V3 671B 在 HS-H8 上以 4 卡 INT4 承载;同时支持 BGE 等向量模型用于 RAG 检索,并支持 LoRA 微调后的私有模型部署。
推理服务提供 OpenAI 兼容 API,可对接现有 OA、IM、客服与业务系统;支持 RAG 知识库挂载、向量检索服务与 Agent 工作流编排,也可与 Owlfy 私有化 Agent 套件协同,形成业务数据闭环。
模型与数据全部在企业物理机内运行,推理链路不经过任何外部网络;平台提供多租户权限隔离、操作日志与访问审计;管理链路支持国产 BMC,满足信创环境对管理组件自主可控的要求。
三档方案同属一个平台族,扩容路径清晰:S1 可加卡升级为 M2,M2 可组双机高可用,H8 可横向扩展为多机算力池;软件栈一致,无需推翻重来。机柜空间、电源与网络按升级目标预留即可。
参考价覆盖整机硬件(CPU/内存/存储/电源/机箱/加速卡)、系统与推理栈预装、部署调优与初始模型适配。维保、7×24 服务、季度巡检与后续模型升级按年服务包提供。实际价格以项目询价为准。