登录社区云,与社区用户共同成长
邀请您加入社区
页面中,“Get Free Access” 再次登录账号后,继续相关信息的填写。在ND-Range中的for循环中需要多次写入全局内存,所以可以考虑使用一个临时变量记录A和B矩阵work-group相乘的结果,在for循环执行结束后再写入C矩阵,这样就可以减少对全局内存的读写,也可以提高运行速度。由于要对矩阵乘法不断优化,所以选择写一个主函数,在主函数中记录运行时长,随后只需要为不同的方法实现矩阵
本次实验可以在Dev Cloud中使用JupyterLab进行。需要先进行Dev Cloud的注册。
在DevCloud平台打开终端,直接使用上面的命令对目标文件进行编译。在自己的linux设备上安装 sycl编译器官方提供的sycl示例链接
Intel oneAPI项目实践技术报告
Intel DevCloud的教程样例无法运行。故计是因为intel更新了devcloud但是没有更新对应的教程文档。以下是一些尝试的debug,但没有de出来,可以不用看了。。。