富士通介绍 PHOTON 框架:1.2B 模型多查询性能 475 倍于 Transformer

浏览16次 点赞0次 收藏0次

6 月 25 日消息,富士通 (Fujitsu) 日本当地时间昨日介绍了其开发的 PHOTON(自上而下网络并行分层计算)架构,宣称其在多查询(生成多个备选结果并在此基础上给出最终答案)场景下性能至高可达主流 Transformer 架构的 475 倍。

富士通表示,Transformer 架构的一大弊病是其在长上下文输入或多线程同步处理的场景下会执行大量访存操作来保留历史信息,这往往会导致处理速度下降。PHOTON 能高效率低开销地处理智能体系统等多 I/O 流程,从而降低 GPU 成本。

▲ 左:语义分层;右:并行计算

PHOTON 架构在语义层面上进行分层处理,相较 Transformer 的词元级分割可降低计算复杂度并提供了更好的并行性。而在多查询最后的决策环节,PHOTON 则采用了多数决定或选择最佳的方式,仅需一次推理。

测试结果表明,PHOTON 在 600M、900M、1.2B 等参数规模相对较小的模型中可实现更高的迭代吞吐量和更低的内存占用,其中 1.2B 模型上实现了 475 倍性能和略低的质量。此外,由于 PHOTON 架构每次迭代所需的 KV Cache 更少,还能提升最大迭代次数。

声明:本文转载自IT 之家,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯