分享好友 站长动态首页 网站导航

芯片的创始人

网友发布 2022-07-30 14:47 · 头闻号创业故事

如果要为最近一波芯片找一个先锋,AI芯片当之无愧。

看到GPU在人工智能中发现的巨大机会,广大深度学习追随者开始探索DSA在人工智能应用中的落地尝试。然而,经过多年的试水,很多从业者会发现,AI面临的困难和挑战比他们预想的要多。

在这篇文章中,我们与从2016年开始做AI芯片的行业资深人士李峰进行了交流。在这个过程中,他从一个行业深度参与者的角度分享了自己对行业现状和未来的看法。

人工智能芯片市场现状

华尔街日报今年3月报道称,根据市场研究公司PitchBook Data Inc的数据,人工智能芯片创业公司在2021年通过170笔交易获得了约99亿美元的风险投资,这是2020年人工智能芯片创业公司总资本的三倍多。报道称,这些融资公司从事的领域涵盖AI芯片,旨在优化人工智能和机器学习模型的智能传感器、设备和算法。

知名市场分析师Gartner也表示,全球有超过50家公司正在制造专门针对AI的芯片。据估计,用于执行人工智能任务的芯片销售额今年将达到443亿美元,到2025年将达到768亿美元。IDC计算半导体研究副总裁谢恩·劳(Shane Rau)直言,目前,大多数AI芯片创业公司依赖于投资者的资本而不是销售额,因此它们不受更广泛的市场力量的影响。

根据以上分析,正如文章开头提到的,大部分AI芯片公司可能还处于产业发展的混乱期。观察市场上的AI应用,你可能会看到广泛使用的场景是智能安防。但是在很多其他领域,你可能希望看到AI快速下沉,但是感觉适得其反。

当被问及AI芯片热潮的原因时,李峰举了一个例子来说明背后的驱动力之一。他指出,在深度学习早期的端到端加速方案中,有很多SIMD DSP的案例,例如多家公司的多款集成了CEVA XM4/XM6的芯片,其中XM4/XM6就是典型的SIMD DSP。但是DSP的特性决定了它可以作为灵丹妙药,但是当它用在特定领域的时候,却发现并不是最合适的,于是市场上很快就出现了专用的AI加速芯片。

放大了,这也是整个AI芯片行业蓬勃发展的典型。

不过,李峰表示,在关注度大增的AI市场,过去几年也出现了一些乱象,其中“实际计算能力与纸面计算能力不符”等典型现象就是上述计算单元实际利用率问题的背后。在他看来,这种现象在市场上比比皆是。

“AI芯片市场的现状来自于落地问题,尤其是在端到端,端到端的应用是碎片化的,需要根据场景定制AI模型,训练模型需要大数据,所以大数据的获取就成了问题”,李峰补充道。同时他指出,如果说在山寨手机时代,原芯片厂还能做“交钥匙”方案,那么在AI时代,原芯片厂就无能为力了,关键是原芯片厂没有办法获取数据。同时开发者社区和解决方案公司都面临着这个问题,导致整个AI应用开发的活跃度不高。

“你看到的AI应用更多的是图像处理,也就是用AI来补充ISP的功能。不否认AI对图像处理有帮助,但不是通常意义上的机器视觉应用。”李峰强调。

AI芯片的难点在哪里?

可能很多人和李峰一样,在进入AI芯片的时候低估了难度。作为一个研究这个行业多年的资深人士,李峰也总结了自己过去几年对AI芯片的一些看法,以及他认为的一些挑战。

首先,李峰指出,AI是一个运算密集型应用,并行计算量大,所以运算单元和存储单元之间的数据传输非常频繁,数据流是功耗的主要原因。“所以AI芯片的一个重要指标就是能效,而SIMD DSP被换掉的一个重要原因就是这个指标不够好。”李锋接着说。

他告诉记者,这个指标的影响因素之一是内存访问。所以这些学术界的研究成果大多集中在这个事情上,总结出了AI芯片的三个设计原则:1。分级存储;2、数据复用;3.片内互连。这三个原则必须同时使用才能达到减少内存访问的效果,其中不同的数据复用算法会有不同的微架构。

“总体来说,AI芯片的硬件架构比较简单,像谷歌的TPU,只有五条指令,其中两条是内存访问指令,另外三条是操作指令。可以看出,AI芯片的硬件设计重点在于如何在提高计算并行性的同时,最大限度地减少内存访问,从而达到提高能效的目的。”李峰告诉记者。

另外,AI芯片的难点更多在于软件部分,也就是配套的工具链。其中两个工具非常重要:一个是编译器,一个是量化工具。

首先看编译器方面。以英伟达为例。就算没用过,也应该都知道NVIDIA GPU在AI市场上是无敌的。除了性能领先,芯片巨头打造的CUDA生态系统也是不可或缺的一部分。

东吴证券的报告认为,GPU的微架构天然适合矩阵并行计算,能力不仅限于显卡领域。所以从21世纪初开始,专业计算人员就想用GPU做一些与AI相关的并行计算。但是在CUDA出现之前,要调用GPU的计算能力,必须编写大量的低级语言代码,这对于主要使用高级语言的程序员来说,是不折不扣的噩梦。鉴于此,英伟达公司的大卫·柯克(David Kirk)主导推出了CUDA系统,这是一种基于英伟达GPU平台定制的特殊计算系统/算法。一般只能在Nvidia GPU系统上使用。

Nvidia这个一开始并不被看好的项目,现在已经成为公司最坚实的堡垒。前几年一些AI芯片和GPGPU的创业者,在发布产品的时候,大多都在讲与CUDA的兼容性,这足以证明一个好编译器的价值。根据英伟达在GTC 2022上公布的数据,CUDA平台自2008年推出以来,已被下载超过3300万次。仅2021年就有800万次下载,三年增长三倍。

李峰还指出,虽然编译器并不是什么新技术,但是基于并行计算的编译器还没有成熟,运算单元的利用率很大程度上取决于编译器。换句话说,即使硬件水平达到了足够高的并行度,但由于编译器的原因,实际可以调用的运算单元也达不到要求,体现为计算能力不足。

“此外,还有多种量化技术,多种流派并存。虽然量化手段的多样性给用户带来了多种选择,但最终似乎没有一个学校胜出,这给跨平台开发和移植带来了一些不便。”李峰告诉记者。

“总之这两个工具是AI芯片的难点,做好不容易!”李峰强调。

AI芯片何去何从?

虽然困难很多,但人工智能是大势所趋,AI芯片也是必然需求。对于相关从业者来说,需要考虑的是未来的AI芯片将何去何从。

针对这个问题,李峰回答说,很大程度上取决于AI算法的进化。他指出,目前CNN和transformer算法架构并存。从硬件的角度来看,这是两种类型的操作。前者是卷积运算,后者是矩阵乘法,对硬件设计的要求不同。

“在处理卷积运算时,专用硬件具有空的功能,或者说是创新的契机;然而,在处理矩阵乘法时,是否必须使用特殊的硬件是未知的,因为通用处理器对于这种运算应该足够成熟。”李峰说。

同时他重申,在数据中心市场,GPU架构是事实上的标准,其他架构难以撼动。特别是专用硬件,在云计算领域基本没有机会。“在端到端的市场上,如果transformer最终胜出,不排除会有直接将算法硬件化的芯片出现,这也和我们近几年DSA概念的提出是一致的。”李锋接着说。

同时,李峰也谈到了近年来内存计算概念在AI市场的火热契机。

他指出,近年来比较火的内存中计算和神经形态学计算可以归入模拟计算领域。其中,内存计算最早出现在AI领域,原因有三:一是内存访问问题,即内存墙问题;二是量化精度进入int8时代;第三,AI的本质是近似计算。三是内存计算出现在AI领域的条件。

“但这里有一个问题,就是支持模拟计算的软件开发环境整体上并不成熟。换句话说,虽然硬件是模拟计算或非冯诺依曼架构,但软件却被强制兼容冯架构,否则开发者无法使用。事实上,这是一个非常严重的问题。”李峰告诉记者。“说白了,内存计算或神经形态学计算等模拟计算应该有自己的软件开发流程和方法论,但目前还不具备。不清楚什么时候能上市。”李峰解释道。

在李峰看来,在这个过渡时期,模拟计算或者内存计算的优势相对有限。证据之一就是这类芯片中有大量用于数模转换的ADC/DAC。但是这些ADC/DAC对芯片整体指标的影响是显而易见的。

“就像给苏穿上紧身皮裤一样,不会超过9秒83。”李峰说。

关于中泰信用社

中泰信和智能科技是新通信、新智能时代的行业数字化解决方案服务商。公司自成立以来,整合上下游优质资源,依托强大的科研能力,深耕数字化升级领域,为新基础设施时代的企事业单位数字化升级提供专业、可靠、全生命周期的技术服务。

公司现有员工近200人,拥有三个博士团队和一个研发中心,与国内多所重点高校和科研院所有着良好的合作关系。公司下设智能集成事业部、智能交通事业部、综合通信事业部、融合视频事业部、AI工业视觉事业部、智能物联网事业部六大业务板块,涵盖传统智能工程业务和新兴技术方向。是国有通信运营商的深度战略合作伙伴,业务范围包括智慧城市、智慧建筑、智慧医院、智慧能源、智慧商业、智慧工业等领域。

中泰始终坚持“以客户为中心,以人才为导向”的核心价值观,肩负“成为卓越的智慧城市和智慧公共安全服务商”的使命,构建“让城市更智慧,让世界更安全”的企业愿景,不断创新,开拓进取,不断提升企业的品牌价值。

免责声明:本平台仅供信息发布交流之途,请谨慎判断信息真伪。如遇虚假诈骗信息,请立即举报

举报
反对 0
打赏 0
更多相关文章

评论

0

收藏

点赞