SiliconLLM是硅基流动(SiliconFlow)自研的大语言模型推理引擎,属于算力层与模型层之间的系统软件。[1][2] 它通过芯片、框架、模型等层面的联合优化提升推理效率,并支持多种厂商芯片的适配,曾被用于在国产算力上部署DeepSeek系列模型。[3] 该引擎也是硅基流动云服务平台SiliconCloud的底层推理引擎之一。[4]
定义
SiliconLLM是硅基流动自主研发的大语言模型推理引擎,也是其高性能大模型推理套件的组成部分,与文生图、视频生成加速库OneDiff并列。[2] 从产业分层看,它属于AI基础设施中的系统软件,处在算力层和模型层之间,向上承接模型的推理请求,向下调度硬件资源。[1] 硅基流动对其设计目标的表述是开箱即用、易用且可扩展,便于开发者较低成本地完成大模型部署与调用。[5]
原理
SiliconLLM采用芯片、框架、模型、应用四个层次的联合优化。芯片层以统一的运行时、算子与通信接口接入不同厂商的GPU,并借助高性能算子调用芯片原生指令,其加速比可达5倍以上;框架层侧重执行效率、显存利用、通信与精度;模型层针对稠密模型与混合专家模型分别做计算图编译和缓存优化;应用层提供可直接使用的服务化与编排能力。[6] 官方称,这种从芯片到应用的端到端优化可使推理效率最高达到同类开源方案的10倍。[3]
在分布式部署方面,该引擎采用预填充与解码分离的架构,并配合大规模专家并行策略,让两类计算各自落到擅长的硬件上执行。[3][6] 在昇腾芯片上运行MoE结构的DeepSeek-R1时,模型、机制与算子三层的协同优化使首token时延下降80%,系统吞吐提升一倍。[3]
针对解码阶段逐token生成、受显存带宽制约的问题,SiliconLLM采用多token预测型投机采样策略:让投机模型直接使用主模型最后一层的隐状态作为输入,降低模型切换与数据搬运造成的调度开销,把闲置算力转化为生成速度。[7] 引擎还支持FP8等低精度推理,并通过与硬件解耦的量化方案,使低精度在异构芯片上的性能与精度接近原生FP16。[8][6]
发展历程
SiliconLLM由2023年8月成立的硅基流动推出,公司创始人袁进辉是一流科技创始人、光年之外联合创始人。[2] 团队把创业方向定在模型推理而非模型训练,公司成立初期即把大语言模型推理引擎与文生图加速库作为核心产品。[9]
2024年1月,硅基流动完成5000万元天使轮融资,SiliconLLM当时已作为公司高性能推理套件的组成部分对外介绍。[2] 2024年7月,公司完成近亿元人民币的天使+轮融资,并称该引擎的生成速度比同类开源产品快10倍以上。[1]
2025年2月,硅基流动完成由华创资本领投的亿元人民币Pre-A轮融资,同时表示已走通在国产芯片上部署DeepSeek模型的路径。[10] 2025年4月10日,公司宣布与华为云联合,基于CloudMatrix 384超节点昇腾云服务与SiliconLLM上线DeepSeek-R1,在保证单用户20 TPS的前提下,单卡解码吞吐突破1920 token/s。[11][12] 2026年6月30日,硅基流动向港交所递交招股书。[13]
应用
SiliconLLM是硅基流动云服务平台SiliconCloud的底层推理引擎之一,与OneDiff共同承担平台上大模型的推理加速,该平台提供包括DeepSeek、Qwen、FLUX.1等在内的上百款模型接口。[4]
面向企业客户,硅基流动提供本地化部署方案:由客户自备算力,公司把引擎与算力编排系统部署进客户数据中心,收取软件许可、实施与维保费用。[14] 在一个大型央企的案例中,SiliconLLM被用于千亿参数自研模型和多厂商GPU共存的环境,使单路推理成本下降70%,单台服务器吞吐量提升800%。[3]
在以国产算力为基础的一体机产品中也能见到该引擎。硅基流动与昆仑技术联合推出的DeepSeek一体机采用昇腾AI处理器搭配SiliconLLM,官方实测其性能较同类产品提升35%以上,DeepSeek-R1-671B满血版吞吐为2599 token/s。[15] 在与摩尔线程的联合验证中,引擎在MTT S5000上以FP8精度运行DeepSeek-V3 671B,单卡prefill吞吐超过4000 token/s,解码吞吐超过1000 token/s。[8]
局限
有分析指出,SiliconLLM定位为介于算力层与模型层之间的系统软件,本身不掌握芯片等硬件资源,也没有形成软硬件一体化。[13] 如果行业走向少数头部厂商主导、全栈自研成为主流,这类第三方引擎的价值可能受到挑战。[13]
该引擎通过缓存复用、任务拆分、预测解码等方式提升单卡处理效率,但若客户调用量不足,固定的租卡成本难以摊薄,单位成本反而会被推高。[14]
由于需要针对不同模型与不同芯片做交叉优化,而模型迭代速度较快、部分模型可能被市场淘汰,相关研发投入存在难以收回的风险。[13] 其业务也在较大程度上取决于高质量开源模型是否可得。[13]
参见
参考资料
- 2024-07-04 硅基流动获近亿元天使+轮融资,推动AGI技术普惠化 . lieyuncapital.com [引用日期2026-09-29]
- 硅基流动完成5000万元天使轮融资-品玩 . pingwest.com [引用日期2026-09-29]
- 企业什么时候需要部署推理加速框架? . siliconflow.cn [引用日期2026-09-29]
- 硅基流动完成新一轮亿元人民币融资 . baai.ac.cn [引用日期2026-09-29]
- 硅基流动完成5000万元天使轮融资 . zhihu.com [引用日期2026-09-29]
- 硅基流动自研推理引擎四层联合优化框架:芯片-框架-模型-应用协同优化,推理效率最高达开源10倍【图】 . sgpjbg.com [引用日期2026-09-29]
- 国产芯片优化3:如何利用MTP策略提升Decode吞吐,将过剩算力转化为推理速度? . siliconflow.cn [引用日期2026-09-29]
- 单卡 Prefill 破 4000,Decode 超千!硅基流动联合摩尔线程实现国产 GPU 推理性能飞跃 . qq.com [引用日期2026-09-29]
- 硅基流动完成新一轮亿元人民币融资 . 163.com [引用日期2026-09-29]
- 袁进辉新公司硅基流动获创新工场、王慧文等 5000 万投资,有哪些信息值得关注? . zhihu.com [引用日期2026-09-29]
- geekpark.net 上的网页 . geekpark.net [引用日期2026-09-29]
- 比肩 H100!硅基流动上线基于昇腾云 CloudMatrix 超节点的 DeepSeek-R1 . e-works.net.cn [引用日期2026-09-29]
- 硅基流动IPO:比阿里更懂Qwen? . eastmoney.com [引用日期2026-09-29]
- 硅基流动IPO,Token工厂不好做 . sina.com.cn [引用日期2026-09-29]
- 硅基流动联合昆仑技术推出基于昇腾的 DeepSeek 一体机,性能提升 35% . qq.com [引用日期2026-09-29]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-29T08:57:12Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。