DBHOO · PRODUCT MATRIX
DBHOO 产品矩阵
四条核心产品线,覆盖大语言模型推理、存算一体算法、纳米级运动控制与脉冲神经网络,从云端到边缘、从研究到工业落地。
LPU — 轻量级处理单元
LLM Inference Engine · 极致推理性能
产品定位
专为大规模语言模型推理设计的高性能运行时与算法系统。基于 C99 + CUDA 构建,追求极致推理吞吐量与确定性延迟,覆盖从单卡推理到多节点分布式部署的完整场景。实测 Llama-3-8B INT4 在 H100 上吞吐量达到 6,378 tokens/s,P99.9 延迟控制在均值的 1.18x 以内。
核心特性
C99 + CUDA 内核
底层算法使用纯 C99 实现,关键算子走 CUDA/cuBLAS/Tensor Core,最大化 GPU 利用率与能效比。
多模型与多模态
原生支持 Llama-3、Mistral、Qwen、Zephyr 等主流 LLM,商业版扩展 CLIP/SigLIP/ViT 多模态。
极致确定性延迟
P99 延迟 1.24x 均值、P99.9 延迟 1.18x 均值,面向实时对话与高并发推理服务可预测可调优。
分布式推理集群
NCCL 张量并行 / 流水并行 / 数据并行,WAL Replica 高可用副本,支持数十卡集群线性扩展。
全精度量化矩阵
F32 / FP16 / BF16 / FP8 / INT8 / INT4 全链路量化,GPTQ / AWQ / SmoothQuant 混合量化策略。
高级 KV Cache
Paged Attention、INT4 KV 压缩、Prefix Cache 前缀复用,长上下文显存占用降低 60%+。
推测解码
大小模型推测解码 + 自回归验证,端到端延迟进一步降低 30%~50%。
工具链与多语言绑定
提供 Python / C / Go / Rust / gRPC 全套 API,模型转换、量化、基准测试工具一应俱全。
版本对比
| 功能 | 开源版 (Apache 2.0) | 社区版 (预编译二进制) | 商业版 |
|---|---|---|---|
| GEMM 矩阵乘法 | F32 only | F32 / INT8 | F32 / FP16 / BF16 / INT8 / INT4 / FP8 |
| Attention 注意力 | Naive SDPA F32 | 标准 SDPA | Flash / Paged / SDPA + GQA / MQA |
| 量化 | ✗ 无 | INT8 对称 | GPTQ / AWQ / SmoothQuant / FP8 / INT4 |
| KV Cache | 基础 F32 | 基础 | Paged / INT4 / Prefix Cache |
| GPU 加速 | ✗ 无 | ✗ 无 | ✓ CUDA / cuBLAS |
| 分布式 | ✗ 无 | ✗ 无 | ✓ NCCL / TP / PP / WAL Replica |
| 推测解码 | ✗ 无 | ✗ 无 | ✓ 有 |
| 多模态 | ✗ 无 | ✗ 无 | ✓ CLIP / SigLIP / ViT |
| 技术支持 | 社区 | 无 | 7×24 专属 |
VeriFusion — 商业验证服务
VeriFusion 是独立于推理引擎的验证层,对推理输出进行数学验证、一致性校验和异常检测。采用抽样验证策略(默认 5% 关键层),支持四种部署模式:旁路验证(0% 延迟影响)、同步验证(+5-15%)、异步验证(+1-3%)和全量检查(+30-50%)。每步验证结果均可形成审计日志,满足金融、医疗、法律等场景的合规审计需求。
TrustInfer — 可信推理引擎
TrustInfer 基于 TEE(Intel SGX/TDX、AMD SEV-SNP)构建可验证、可审计、可证明的推理执行环境。三层架构:度量层(启动时验证引擎和模型完整性)、审计层(链式哈希审计日志,不可篡改)、证明层(为单次推理生成可验证的执行证明,任何第三方可用公钥验证)。
PIM — 存算一体算法平台
Processing-In-Memory · 数据为中心的计算范式
产品定位
打破冯·诺依曼瓶颈的存内计算研究与原型平台。基于 C99 + CUDA + OpenCL 构建,覆盖从行为级仿真、Crossbar 工艺建模到 SPICE 级偏差分析的完整研究链路。核心价值在于”数据在哪就在哪算”,增量更新场景最高 3.52× 加速,数据搬运减少 95%,为未来 PIM 芯片设计、算法验证与企业研发提供零硬件依赖的软件参考原型。
核心特性
增量更新 Dirty Pages
只处理变化数据,2000×2000 矩阵 5% Dirty 率时 3.52× 加速,数据搬运减少 95%,适配 SNN / GNN / 在线学习。
自适应调度器
“上帝视角”智能决策引擎,根据矩阵规模、Dirty 率、内存压力自动选择最优路径,决策准确率 100%。
预分配高吞吐策略
高频权重更新吞吐 5,416 updates/sec,内存分配器空闲块智能重用,支持大规模在线学习与持续训练。
Crossbar 工艺建模
行为级 → 5 种工艺 + 高斯噪声 → SPICE 级偏差建模,完整 PIM 芯片仿真链路,支持 ReRAM / MRAM / Flash。
多精度 GEMM 矩阵
F32 / BF16 / FP8 / INT8 / INT4 全精度 GEMM,INT4 支持 VNNI / LUT-NN / AVX2 加速,CosSim > 0.997。
多硬件 HAL 抽象
统一 HAL 插件系统,对接 NVIDIA CUDA / AMD OpenCL / Intel FPGA / 3D CIM / RISC-V / 自研 PIM 芯片。
图编译器与运行时
内置动态计算图、死代码消除、算子融合、ILP 调度器,运行时支持动态批处理、预取、显存规划。
调试与可观测性
内置调试器、Profiler、Trace 系统、Roofline 模型可视化,支持故障注入与黄金模型(Golden Model)对比。
版本对比
| 功能 | 开源版 (Apache 2.0) | 社区版 (预编译二进制) | 商业版 |
|---|---|---|---|
| FP32 GEMM | 朴素实现 | ✓ | 优化实现 |
| INT8 GEMM | ✗ | ✓ 基础 | ✓ VNNI / AVX2 |
| INT4 GEMM | ✗ | ✗ | ✓ VNNI / LUT-NN |
| 分组量化 | ✗ | ✗ | ✓ LUT 加速 |
| Crossbar 模型 | 行为级 | 5 种工艺 + 高斯 | SPICE 级 + 工艺偏差 |
| GPU / CUDA | ✗ | ✗ | ✓ |
| FPGA | ✗ | ✗ | ✓ |
| 3D CIM / RISC-V | ✗ | ✗ | ✓ |
| KV Cache / 内存规划 | ✗ | ✗ | ✓ |
| 硬件对接 HAL | ✗ | ✗ | ✓ 插件系统 |
| 定位 | 学习研究 | 芯片验证基线 | 完整功能 |
NM — 纳米运动控制引擎
Nano-Motion Control · ±10nm 硬实时内核
产品定位
面向半导体装备、精密光学、纳米定位、机器人关节等高端场景的硬实时运动控制内核。基于 C99 实现,稳态精度 ±10~50nm,运行于 Xenomai / PREEMPT_RT 双路实时平台。内置 AI 自适应调优、LSTM 异常检测、EtherCAT 主站、G-code 解析、6 轴耦合等高级功能,商业版兼容 IEC 61508 SIL-2 功能安全边界。
核心特性
多算法融合控制
PID + 前馈 + DOB 扰动观测器 + Notch Filter + S-Curve/梯形轨迹,组合实现纳米级稳态精度。
AI 强化学习调优
DDPG RL-PID 在线自适应整定 + 自动频域扫频,动态应对负载、刚度、摩擦变化。
硬实时双平台
Xenomai Cobalt / Linux PREEMPT_RT 双路支持,调度抖动亚微秒级,WCET 可分析可证明。
6 轴耦合与运动学
6 轴联动控制、CCC 交叉耦合、逆运动学(IK)、NURBS/B 样条轨迹,支持龙门 / SCARA / 三角洲。
NMPC 模型预测
非线性模型预测控制,处理多约束、多目标优化问题,面向高速高精度轨迹跟踪。
EtherCAT 主站
CherryECAT 嵌入式主站,CiA402 状态机、CoE/SoE 协议、数百轴同步抖动 < 1µs。
功能安全 SIL-2
SIL-2 兼容安全状态机、STO/SS1/SS2 安全功能、看门狗、E-STOP 双通道检测与响应。
PHM 与健康管理
LSTM 异常检测 + 预测性维护(PHM)+ 黑盒记录仪,支持数字孪生与远程诊断。
版本对比
| 功能 | 开源版 (MIT) | 商业版 |
|---|---|---|
| PID / Notch / S-Curve / 前馈 | ✓ | ✓ |
| 控制轴数 | 2 轴 | 6 轴 |
| DOB 扰动观测器 | ✗ | ✓ |
| NMPC 模型预测控制 | ✗ | ✓ |
| RL-PID 强化学习 | ✗ | ✓ |
| 自动调优 / 自适应 PID | ✗ | ✓ |
| 6 轴耦合 / CCC / IK | ✗ | ✓ |
| 安全状态机 (IEC 61508) | ✗ | ✓ SIL-2 兼容 |
| EtherCAT 驱动 | ✗ | ✓ CherryECAT |
| G-code 解析 | ✗ | ✓ |
| LSTM 异常检测 / PHM | ✗ | ✓ |
| NURBS / B 样条轨迹 | ✗ | ✓ |
| 力控制 | ✗ | ✓ |
| 内存占用 | < 512KB | < 1MB |
SNN — 脉冲神经网络
Spiking Neural Network · 第三代神经网络框架
产品定位
基于 Rust 构建的第三代神经网络实现,采用插件化架构。覆盖脉冲编码、事件驱动、时间编码、低功耗推理、no_std 嵌入式部署,并通过 HAL 抽象层接入 Loihi / SpiNNaker / MZI 光子阵列等专用硬件。配套 Surrogate Gradient 训练、群体智能 NanoSwarm、ONNX 互操作、授权签名校验,从纳米机器人、微控制器、边缘设备到光子计算全线覆盖。
核心特性
多种脉冲编码
Rate / Temporal / Rank-Order / Phase / Burst 编码,逼近生物神经元时间动态特性。
事件驱动稀疏计算
仅在脉冲发生时触发计算,天然适配 DVS 事件相机、异步传感器,功耗降低 10~100×。
no_std 嵌入式
核心库零标准库依赖,ARM Cortex-M / RISC-V 裸机部署,Tiny 版总内存占用 < 10KB。
多硬件 HAL 后端
Intel Loihi、SpiNNaker、MZI 光子阵列、ARM MCU 统一抽象,插件化热插拔。
Surrogate Gradient 训练
代理梯度反向传播 + 光学训练支持,端到端训练脉冲网络,MNIST 准确率 > 98%。
NanoSwarm 群体智能
Tiny 版内置纳米机器人集群协同算法,分布式感知与群体决策。
ONNX 互操作
ANN↔SNN 双向转换、SNN 模型导入导出,与 PyTorch / TensorFlow 生态无缝衔接。
插件化生态体系
Grow(生长网络)、Bionic(仿生记忆)、RL(强化学习)、Signal(信号处理)、VectorDB(向量库)等丰富插件。
版本对比
| 功能 | 开源版 (MIT / Apache) | Lite 版 | Tiny 版 | Pro 版 | Photonic 版 |
|---|---|---|---|---|---|
| 定位 | 研究 / 教育 | 边缘设备 | 纳米机器人 | 企业级 | 光子计算 |
| 神经元模型 | LIF 参考实现 | INT8 量化 5 种 | 定点 4 种 | 完整 + SIMD | MZI 光子 |
| 内存 / 神经元 | 32+ 字节 | 4-10 字节 | 2-8 字节 | 32+ 字节 | — |
| 网络规模 | 100 神经元 | 中等 | < 10KB 总内存 | 1000 神经元 | 大规模 |
| 训练 | ✗ | ✗ | ✗ | ✓ Surrogate Gradient | ✓ 光学训练 |
| 分布式 | ✗ | ✗ | ✗ | ✓ | ✓ LPU 集群 |
| GPU 加速 | ✗ | ✗ | ✗ | ✓ | ✗ |
| 群体智能 | ✗ | ✗ | ✓ NanoSwarm | ✗ | ✗ |
| 硬件支持 | ✗ | ✗ | ARM Cortex-M | Loihi / SpiNNaker | MZI 光学阵列 |
| ONNX 互操作 | ✓ | ✓ | ✓ | ✓ | ✓ |
| 授权验证 | 无 | license.json | license.json | Ed25519 签名 | Ed25519 签名 |