产业观察🔥7.0
龙芯发布自研通用 GPU 加速计算平台首个软件版本:支持 OpenCL 3.0、CUDA 及 AI 推理
📋总体概括
龙芯中科于9月22日发布支持自研通用GPU的龙芯加速计算平台首个软件版本,基于2K3000和9A1000芯片集成的LG200系列GPU核心,提供从底层驱动、编译器、运行时环境到AI推理引擎的完整软件栈。平台兼容OpenCL 3.0和CUDA编程接口,集成BLAS、DNN算子库,并推出自研推理引擎LacInfer,标志着龙芯从CPU厂商向CPU+GPU算力平台转型迈出关键一步。
⚡关键信息
- ▸平台基于2K3000和9A1000芯片集成的LG200系列通用GPU核心开发
- ▸兼容OpenCL 3.0和CUDA两类编程接口,通过API层兼容降低迁移适配成本
- ▸BLAS算子针对FP32、INT8等数据类型的GEMM等运算做汇编级优化
- ▸推出自研AI推理引擎LacInfer,支持算子融合等推理加速手段
- ▸调试分析工具支持张量单元状态检查,可定位访存越界、同步死锁等问题
🔥犀利点评
国产芯片生态最缺的从来不是硬件,而是软件栈。龙芯这次直接对标CUDA兼容层,是务实之选——不重造轮子,让存量CUDA开发者能低成本迁移。但兼容永远有性能损耗,CUDA接口是NVIDIA的地盘,随时可能被卡。真正的胜负手在于LG200张量单元的实际算力水平和算子库成熟度,首个版本通常只是能跑通,距离好用还有很长的路。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 IT之家 阅读全文 →