DBHOO · PRODUCT MATRIX

DBHOO 产品矩阵

四条核心产品线,覆盖大语言模型推理、存算一体算法、纳米级运动控制与脉冲神经网络,从云端到边缘、从研究到工业落地。

LPU — 轻量级处理单元

LLM Inference Engine · 极致推理性能

产品定位

专为大规模语言模型推理设计的高性能运行时与算法系统。基于 C99 + CUDA 构建,追求极致推理吞吐量与确定性延迟,覆盖从单卡推理到多节点分布式部署的完整场景。实测 Llama-3-8B INT4 在 H100 上吞吐量达到 6,378 tokens/s,P99.9 延迟控制在均值的 1.18x 以内。

核心特性

C99 + CUDA 内核

底层算法使用纯 C99 实现,关键算子走 CUDA/cuBLAS/Tensor Core,最大化 GPU 利用率与能效比。

多模型与多模态

原生支持 Llama-3、Mistral、Qwen、Zephyr 等主流 LLM,商业版扩展 CLIP/SigLIP/ViT 多模态。

极致确定性延迟

P99 延迟 1.24x 均值、P99.9 延迟 1.18x 均值,面向实时对话与高并发推理服务可预测可调优。

分布式推理集群

NCCL 张量并行 / 流水并行 / 数据并行,WAL Replica 高可用副本,支持数十卡集群线性扩展。

全精度量化矩阵

F32 / FP16 / BF16 / FP8 / INT8 / INT4 全链路量化,GPTQ / AWQ / SmoothQuant 混合量化策略。

高级 KV Cache

Paged Attention、INT4 KV 压缩、Prefix Cache 前缀复用,长上下文显存占用降低 60%+。

推测解码

大小模型推测解码 + 自回归验证,端到端延迟进一步降低 30%~50%。

工具链与多语言绑定

提供 Python / C / Go / Rust / gRPC 全套 API,模型转换、量化、基准测试工具一应俱全。

版本对比

功能 开源版 (Apache 2.0) 社区版 (预编译二进制) 商业版
GEMM 矩阵乘法 F32 only F32 / INT8 F32 / FP16 / BF16 / INT8 / INT4 / FP8
Attention 注意力 Naive SDPA F32 标准 SDPA Flash / Paged / SDPA + GQA / MQA
量化 INT8 对称 GPTQ / AWQ / SmoothQuant / FP8 / INT4
KV Cache 基础 F32 基础 Paged / INT4 / Prefix Cache
GPU 加速 CUDA / cuBLAS
分布式 NCCL / TP / PP / WAL Replica
推测解码
多模态 CLIP / SigLIP / ViT
技术支持 社区 7×24 专属

VeriFusion — 商业验证服务

VeriFusion 是独立于推理引擎的验证层,对推理输出进行数学验证、一致性校验和异常检测。采用抽样验证策略(默认 5% 关键层),支持四种部署模式:旁路验证(0% 延迟影响)、同步验证(+5-15%)、异步验证(+1-3%)和全量检查(+30-50%)。每步验证结果均可形成审计日志,满足金融、医疗、法律等场景的合规审计需求。

TrustInfer — 可信推理引擎

TrustInfer 基于 TEE(Intel SGX/TDX、AMD SEV-SNP)构建可验证、可审计、可证明的推理执行环境。三层架构:度量层(启动时验证引擎和模型完整性)、审计层(链式哈希审计日志,不可篡改)、证明层(为单次推理生成可验证的执行证明,任何第三方可用公钥验证)。