搜索 " 算子 " 相关文章 3 条,显示最新 5 条
网站提交
近日,神州光大宣布,基于深圳河套学院AI训练平台项目团队公开论文的技术路径,依托其自有工程体系独立完成复现与优化,在客户真实业务后训练场景中,在国产算力环境下实现MFU,模型算力利用率,稳定达到34%以上,该结果与论文在AscendSuperPOD上取得的34.22%MFU、较开源基线提升2.93倍的技术结论相互印证,标志着相关技术完...。
互联网资讯
在当前的视频生成技术领域,如何降低端到端时延并实现高效的实时服务一直是行业攻坚的核心难题,针对MiniMaxH3视频大模型在实际落地中涉及多环节时延的系统级挑战,业内近期迎来了一套全新的优化组合方案,vLLM,Omni架构从完整的常驻流水线切入,通过一系列系统级优化手段大幅压榨性能,这些优化包括长序列注意力与通信优化、融合DiT算子、...。
MiniMaxH3的服务是一个系统问题,一个请求要经过一个庞大的Qwen3,VL编码器、一个长序列的音视频DiT、相互独立的视频与音频VAE、设备与进程的边界,最后还要完成H.264,AAC的封装,只优化DiT,其余环节的时延依然留在那里,因此vLLM,Omni从完整的常驻流水线入手,注意力与通信、融合的DiT算子、并行VAE解码、紧...。