一站式配齐、深度优化
成本可控,数据不出域,隐私与性能兼得,AI 助理部署的终极保险箱
1Panel 企业版
1Panel 提供直观易用的 Web 管理界面,让用户轻松部署和管理 AI 应用、运行环境和模型服务。
本地 AI 模型
基于 vLLM 运行 Qwen3.6-35B-A3B-FP8 多模态模型,智能密度高,并发效率高。
MaxKB 专业版
从基础知识问答(RAG)、复杂业务流程自动化(Workflow,工作流)到智能体(Agent),MaxKB 都能轻松满足。
FusionXpark 硬件
巴掌大小的 AI 超算:128GB 统一内存、NVIDIA Blackwell GB10、1 PFLOPS 算力、2TB 存储,1.2kg,办公桌即放即用的工作站。
本地 AI 模型 性能
基于同款硬件的 Qwen3.6-35B-A3B 实测数据,开源可复现,全面超越 GPT-OSS-120B
推理速度(vLLM,BF16)
| 场景 | 输出长度 | 速度 |
|---|---|---|
| 短回复 | 128 tokens | 约 31 TPS |
| 中等回复 | 1,024 tokens | 约 32 TPS |
| 长回复 | 3,831 tokens | 约 32 TPS |
首 token 延迟约 0.1s,输出长度变化下速度稳定
多用户并发(RAG 场景)
| 并发用户 | 适用场景 | 总吞吐 |
|---|---|---|
| 5~10 人 | 小团队助手 | 65~82 TPS |
| 20~50 人 | 部门级部署 | 186~308 TPS |
| 100 人 | 企业峰值 | 约 424 TPS |
200 token 回复、思考模式关闭,零错误完成
能力与基准
- ·35B 总参数、3B 激活(MoE),推理成本低
- ·原生 262K 上下文,可扩展至 1M+
- ·多模态:文本、图像、视频输入
- ·思考模式、工具调用 / MCP
- ·MMLU-Pro 85.3、GPQA Diamond 84.2
- ·经典推理题全通过,Apache 2.0 开源
数据来源:Qwen3.6-35B-A3B on NVIDIA DGX Spark、【实测】NVIDIA DGX Spark 本地部署 Qwen3.6-35B-A3B-FP8 完整教程
Model Card:Huggingface: Qwen3.6-35B-A3B-FP8
一体机价格
飞致云 联合 超聚变 为用户带来专属限时优惠
FusionXpark™ GB 10
巴掌大小的 AI 超算,仅 1.2kg
128GB 统一内存、2TB 存储
NVIDIA Blackwell GB10,1 PFLOPS 算力
* 含一年硬件保修
专属交流群
应用场景交流
最佳实践分享
同行业案例分享
* 5×8 线上支持
