Owlfy
HYGON FULL-STACK · PRIVATE AI INFRASTRUCTURE

国产化私有 AI 算力
从一卡,到一池

基于海光 CPU + DCU 全栈架构的企业级私有化 AI 服务器方案。从单卡推理节点到八卡算力池,模型、数据与算力全部运行在企业自己的机房里——数据不出域,成本可预算,生态类 CUDA 平滑迁移。

数据不出域信创合规类 CUDA 生态72B 级模型单机可载
企业工程师使用本地化 AI 工作台
算力与数据,留在企业机房海光全栈私有化部署 · 单机承载 72B 级大模型
64GBHBM2 单卡显存
896 GB/s显存带宽
CORE VIEW

AI 能力,应当部署在企业自己的机房里——而不是放在别人的数据中心里。

01
THE REAL BOTTLENECK

模型能力不缺,缺的是
一个真正可控的部署底座

公有云大模型很强,但企业核心业务场景要的往往不是"最强模型",而是"数据可控、成本可算、合规可过"的私有化算力。

01

数据出境与泄密风险

企业文档、客户信息、业务数据送入公有云模型,链路不可审计、不可追溯,一旦泄密代价不可控。

02

云端成本线性上升

API 按 token 计费,调用越多越贵;模型升级、并发增长后,三年成本远超一次私有化建设。

03

信创与合规压力

金融、政务、央国企等场景对国产化、自主可控、等保合规有明确验收要求,商用 GPU 难以落地。

04

工具链割裂

模型、向量库、Agent 与业务系统分散在不同环境,无法在同一受控网络内闭环与调优。

THREE CONFIGURATIONS

三档方案,按企业规模与模型负载选型

统一基于海光 CPU + K100-AI DCU 全栈架构,型号与规格可按业务场景定制。

HS-S1 · 入门单卡

单卡推理节点

10–50 人团队

1 × K100-AI · 64GB 显存 · 单机承载 72B 模型

  • 72B 级模型 INT4 量化单卡运行(约 48GB)
  • 32B 模型多实例并发 + 向量检索
  • 文档问答、智能客服、代码辅助等单应用场景
  • 2U 机架 / 塔式形态,普通办公室可部署
  • 1600W 冗余电源,风冷散热
¥18–25 万 整机参考价

含硬件 + 部署调优,渠道价随行情波动

HS-H8 · 高端八卡

全公司算力池

200+ 人 / 算力运营

8 × K100-AI · 512GB 显存 · 训练微调

  • DeepSeek-V3 671B INT4(约 200GB,4 卡)
  • 72B 多实例并发,多租户算力隔离
  • LoRA 微调、增量训练与模型版本管理
  • 4U 八卡形态,3200W 3+1 / 2+2 冗余电源
  • 可扩展为多机集群 + 集中存储
¥75–95 万 整机参考价

含硬件 + 部署调优,渠道价随行情波动

SPECIFICATION MATRIX

三档配置逐项对比

同一平台族,三档算力密度。从单卡到八卡,CPU、内存、存储、电源按负载规格逐级放大,迁移路径清晰。

配置项HS-S1 入门单卡HS-M2 主流双卡HS-H8 高端八卡
AI 加速卡1 × 海光 K100-AI64GB HBM2 · 896GB/s · FP16 192 TFLOPS2 × 海光 K100-AI128GB 总显存 · 推理高并发8 × 海光 K100-AI512GB 总显存 · 支持 671B 级模型
CPU海光 7000 系列单路/双路 · 最高 64 核 128 线程双路 海光 7480/749064 核 × 2 · DDR5 内存通道双路 海光 749064 核 × 2 · 400W TDP 旗舰
内存128GB DDR4/DDR5 ECC可扩展至 256GB256GB DDR5 ECC可扩展至 512GB512GB–1TB DDR5 ECC满足多实例与微调
存储2 × 960GB NVMe系统 + 模型分区2 × 1.92TB NVMe模型 + 向量库4 × 3.84TB NVMe多模型库 + 数据集
电源1600W 1+1 冗余单卡满载约 1.5kW2700W 3+1 冗余双卡满载约 2.5kW3200W 3+1 / 2+2 冗余八卡满载约 6.5–8kW
形态2U 机架 / 塔式风冷,普通机房可部署2U 机架风冷,双卡直连4U 机架八卡高密度 · 前后维护
模型承载72B INT4 · 32B 并发Qwen / DeepSeek 开源系72B INT8 · 多模型共存72B + 32B + 向量671B INT4 · 训练微调DeepSeek-V3 · LoRA
参考价¥18–25 万渠道参考(2026-09)¥35–45 万渠道参考(2026-09)¥75–95 万渠道参考(2026-09)

* 价格为渠道参考区间,随供需与汇率波动;实际以采购询价为准。显存占用口径:72B INT4≈48GB / INT8≈80GB / FP16≈144GB;DeepSeek-V3 671B INT4≈200GB;32B INT4≈22GB。

HARDWARE ARCHITECTURE

海光全栈:CPU 与 DCU
在同一平台内协同

计算与加速同源同厂——x86 兼容 CPU 负责调度与数据通路,K100-AI DCU 负责大模型推理与训练,避免异构平台间的适配损耗。

加速卡海光 K100-AI(DCU)
显存64GB HBM2 · 5120-bit
显存带宽896 GB/s
算力FP16/BF16 ≈ 192 TFLOPS
接口PCIe 4.0 x16
供电12VHPWR 16-pin · 350W TDP
CPU海光 7000 系列 · 最高 64C/128T
内存DDR5 ECC · 8 通道
软件栈DTK 工具链 · vLLM · 主流开源模型

72B 级模型单卡可载:K100-AI 64GB 显存直接承载 Qwen3-72B / DeepSeek-R1-70B INT4 量化推理,中小规模团队一台入门机即可上线,无需凑卡。

4U GPU 服务器前面板
PLATFORM & POWER DELIVERY

硬件平台与供电架构
按 7×24 满载可靠性设计

服务器长期稳定,供电是地基。本方案的平台供电按企业级满载工况设计,全链路可遥测、可封顶、可演进。

CPU 供电域

每路 10–12 相 DrMOS 设计

海光 7000 系列 CPU 平台供电按 每路 10–12 相 规划,功率级选用 90A 级 DrMOS(英飞凌 / MPS 方案),搭配数字 VR 控制器,双路满载供电余量充足,长期负载率控制在额定 60% 以内,为可靠性留足裕度。

电源管理总线

PMBus 遥测与功耗封顶

VR 控制器支持 PMBus/SMBus 遥测,电压、电流、温度、功耗实时上送;支持功耗封顶(Power Capping)与动态调压,BMC 可带外读取全链路供电健康状态。

加速卡供电域

12VHPWR 独立供电链路

K100-AI 额定 350W,PCIe 插槽仅提供 75W,其余功耗由 12VHPWR 16-pin 外接供电 补充(线材按卡数配齐)。卡载独立 VRM 完成板级供电,整机只需保证 PSU 容量与 12V 分配。

带外管理

BMC 全栈管理

平台搭载企业级 BMC(IPMI/Redfish),支持远程开关机、固件升级、硬件健康监控与告警;可选国产 BMC 方案,满足信创管理链路的全自主要求。

面向下一代算力芯片的供电演进

平台供电架构预留 TLVR(跨电感稳压器)+ Dual SPS(双芯合封功率级)演进路径——该组合方案可显著提升电源转换密度与瞬态响应,为下一代更高功耗的 DCU 芯片供电做好准备,现有投资可平滑升级。

MODEL CAPACITY

显存承载矩阵:模型与档位一一对应

以下是主流开源模型在不同量化精度下的显存占用与推荐档位(INT4 为 4-bit 量化,INT8 为 8-bit 量化,FP16 为半精度)。显存是私有化部署的第一约束,选对档位即可一机到位。

Qwen3-72B /
DeepSeek-R1-70B
70B 级旗舰
  • INT4≈ 48GB
  • INT8≈ 80GB
  • FP16≈ 144GB
S1 单卡可载 INT4
Qwen3-32B
32B 中量级
  • INT4≈ 22GB
  • INT8≈ 36GB
  • FP16≈ 64GB
S1 多实例并发
DeepSeek-V3 671B
671B 超大规模
  • INT4≈ 200GB
  • INT8≈ 340GB
  • FP16≈ 1.3TB
H8 四卡承载 INT4
BGE-M3 向量模型
检索嵌入
  • 模型体量≈ 2GB
  • 任意档位均可承载
  • 用途RAG 知识检索
与主模型共存
SOFTWARE STACK

类 CUDA 生态:
迁移成本国产方案最低

海光 DCU 采用类 CUDA/HIP 的编程模型,主流推理框架与开源模型均可直接适配,企业已有代码与团队技能可平滑过渡。

DTK 工具链

海光官方开发者工具包,类 CUDA 编程接口与编译器,支持 CUDA 代码迁移,迁移成本在国产芯片方案中最低。

vLLM / SGLang

主流高性能推理引擎原生支持,提供高吞吐、低延迟的在线推理服务与 OpenAI 兼容 API。

模型生态

Qwen、DeepSeek 等主流开源模型开箱适配,支持 LoRA 微调、权重转换与私有模型部署。

操作系统

兼容麒麟、统信 UOS 等国产操作系统,亦支持主流 Linux 发行版,与既有 IT 体系无缝衔接。

生态完整度说明:K100-AI 已规模化出货、供应稳定,推理生态覆盖主流框架;实际性能以 POC 实测为准,交付前我们会用目标模型做一轮基准验证。

DEPLOYMENT TOPOLOGY

从单机到集群,
算力随业务平滑扩展

同一套软件栈,起步一台入门机,业务增长后按节点扩容,不推翻重来。

工程师部署服务器机柜
01

单机独立部署

HS-S1 / HS-M2 一台到位:模型 + 向量库 + 业务服务同机运行,办公室或机房均可部署,当天上线。

02

双机高可用

HS-M2 双机主备 + 共享存储,业务连续性有保障,适合对稳定性要求高的生产环境。

03

算力池 / 集群

HS-H8 多台组成算力池:负载均衡、多租户隔离、集中存储与监控,支撑全公司级算力运营。

04

与 Owlfy 生态联动

可与企业现有 OA/IM/业务系统打通,与 Owlfy 私有化 Agent 套件协同,形成数据闭环。

TOTAL COST OF OWNERSHIP

三年 TCO:
一次建设,成本可预算

按中型团队日调用量估算,云 API 三年费用远高于私有化一次性建设;模型与数据沉淀在本地,边际成本趋于零。

HS-S1 单卡

入门级对比

¥20万一次性建设
私有化 3 年总成本≈ ¥25 万
云 API 3 年估算≈ ¥100 万+

含硬件、电费与维保;云侧按 72B 级模型日均百万 token 估算,3 年线性累计。

HS-M2 双卡

主流级对比

¥40万一次性建设
私有化 3 年总成本≈ ¥48 万
云 API 3 年估算≈ ¥200 万+

多应用高并发场景;数据本地留存,无 token 计费、无传输损耗。

HS-H8 八卡

算力池对比

¥85万一次性建设
私有化 3 年总成本≈ ¥100 万
云 API 3 年估算≈ ¥400 万+

覆盖训练微调与多租户推理;算力资产可折旧、可复用、可对外运营。

* 电费按 0.6 元/kWh、7×24 运行估算:S1 满载约 1.5kW(≈1.3 万元/年)、M2 满载约 2.5kW(≈1.8 万元/年)、H8 满载约 6.5–8kW(≈4.2 万元/年)。云侧估算基于公开 API 定价区间与典型用量,仅供参考;实际成本以项目级报价与用量核算为准。

COMPLIANCE & SECURITY

合规与安全,从芯片到管理链路

面向信创验收与数据安全要求设计,全链路可解释、可审计。

数据不出域

模型与数据全部落在企业物理机内,推理链路不经过任何外部网络,满足数据本地化与保密要求。

信创全栈

国产 CPU + 国产 DCU + 可选国产 OS/BMC/中间件,整机满足信创目录与国产化率验收要求。

供应稳定

海光 DCU 未被列入出口管制实体清单,芯片供应与量产节奏稳定,不受海外政策波动影响。

权限与审计

多租户权限隔离、操作日志、模型访问审计,满足企业内部数据治理与安全合规检查。

OPERATION & SERVICE

交付不是终点,
运维与调优持续在线

从 POC 验证到长期运营,覆盖硬件维保、软件升级与模型迭代的完整服务链。

整机交付与部署

预装系统与推理栈,到货即用;工程师现场/远程完成部署与业务接入。

性能调优

针对目标模型做量化、并行、显存与吞吐调优,输出基准测试报告。

7×24 响应与巡检

远程监控 + 季度巡检 + 备件保障,硬件故障快速响应,业务不中断。

模型与版本升级

新模型发布后的适配与升级、LoRA 微调支持、扩容规划建议。

运维监控中心
DEPLOYMENT ROADMAP

从询价到上线,
四周内跑通第一条业务

标准交付路径,每个阶段有明确的输入与产出,随时可查进度。

1
第 1–2 周

需求与 POC

目标模型基准测试,验证吞吐、延迟与显存,确定档位与配置。

2
第 2–4 周

下单与备货

整机下单、出厂质检与预装系统,交付周期以商务为准。

3
第 4–5 周

部署与调优

上架、组网、推理栈部署、量化与并发调优,输出性能报告。

4
第 5–8 周

业务接入

对接知识库、业务系统与 Agent,联调测试并灰度上线。

5
长期

运营与扩展

监控、巡检、模型升级与扩容规划,随业务增长平滑演进。

FAQ

常见问题

海光是国内唯一拥有 x86 永久授权的国产芯片厂商,CPU 与 DCU 全栈自研;DCU 采用类 CUDA/HIP 架构,企业现有模型与代码迁移成本在国产方案中最低;K100-AI 单卡 64GB 显存即可承载 72B 级模型,且量产供应稳定、未被列入出口管制实体清单。

支持 Qwen、DeepSeek 等主流开源模型系。Qwen3-72B / DeepSeek-R1-70B 单卡 INT4 运行;DeepSeek-V3 671B 在 HS-H8 上以 4 卡 INT4 承载;同时支持 BGE 等向量模型用于 RAG 检索,并支持 LoRA 微调后的私有模型部署。

推理服务提供 OpenAI 兼容 API,可对接现有 OA、IM、客服与业务系统;支持 RAG 知识库挂载、向量检索服务与 Agent 工作流编排,也可与 Owlfy 私有化 Agent 套件协同,形成业务数据闭环。

模型与数据全部在企业物理机内运行,推理链路不经过任何外部网络;平台提供多租户权限隔离、操作日志与访问审计;管理链路支持国产 BMC,满足信创环境对管理组件自主可控的要求。

三档方案同属一个平台族,扩容路径清晰:S1 可加卡升级为 M2,M2 可组双机高可用,H8 可横向扩展为多机算力池;软件栈一致,无需推翻重来。机柜空间、电源与网络按升级目标预留即可。

参考价覆盖整机硬件(CPU/内存/存储/电源/机箱/加速卡)、系统与推理栈预装、部署调优与初始模型适配。维保、7×24 服务、季度巡检与后续模型升级按年服务包提供。实际价格以项目询价为准。

DEPLOY PRIVATE AI

让大模型,部署在你自己的机房里