[人工智能] PyTorch 多GPU使用torch.nn.DataParallel训练参数不一致问题

开发: C++知识库 Java知识库 JavaScript Python PHP知识库人工智能区块链大数据移动开发嵌入式开发工具数据结构与算法开发测试游戏开发网络协议系统运维
教程: HTML教程 CSS教程 JavaScript教程 Go语言教程 JQuery教程 VUE教程 VUE3教程 Bootstrap教程 SQL数据库教程 C语言教程 C++教程 Java教程 Python教程 Python3教程 C#教程
数码: 电脑笔记本显卡显示器固态硬盘硬盘耳机手机 iphone vivo oppo 小米华为单反装机图拉丁

-> 人工智能 -> PyTorch 多GPU使用torch.nn.DataParallel训练参数不一致问题 -> 正文阅读

[人工智能]PyTorch 多GPU使用torch.nn.DataParallel训练参数不一致问题

在多GPU训练时，遇到了下述的错误：

1. Expected tensor for argument  1 'input' to have the same device as tensor for argument  2 'weight'; but device 0 does not equal 1 
2. RuntimeError: Expected all tensors to be on the same device, but found at least two devices, cuda:1 and cuda:0!

造成这个错误的可能性有挺多，总起来是模型、输入、模型内参数不在一个GPU上。本人是在调试RandLA-Net pytorch源码，希望使用双GPU训练，经过尝试解决这个问题，此处做一个记录，希望给后来人一个提醒。
经过调试，发现报错的地方主要是在数据拼接的时候，即一个数据在GPU0上，一个数据在GPU1上，这就会出现错误，相关代码如下：

return torch.cat((
            self.mlp(concat),
            features.expand(B, -1, N, K)
        ), dim=-3)

上述代码中，必须保证self.mlp(concat)与features.expand(B, -1, N, K)在同一个GPU中。在多GPU运算时，features（此时是输入变量）有可能放在任何一个GPU中，因此此处在拼接前，获取一下features的GPU，然后将concat放入相应的GPU中，再进行数据拼接就可以了，代码如下：

device = features.device
concat = concat.to(device)

return torch.cat((
            self.mlp(concat),
            features.expand(B, -1, N, K)
        ), dim=-3)

该源码中默认状态下device是一个固定的值，在多GPU训练状态下就会报错，代码中还有几处数据融合，大家可以一句上述思路做修改。此外该源码中由于把device的值写死了，训练好的模型也必须在相应的GPU中做推理，如在cuda0中训练的模型如果在cuda1中推理就会报错，各位可以依据此思路对源码做相应的修改。如果修改有困难，可以私信我，我可以把相关修改后的源码分享。

人工智能最新文章

2022吴恩达机器学习课程——第二课（神经网

第十五章规则学习

FixMatch: Simplifying Semi-Supervised Le

数据挖掘Java——Kmeans算法的实现

大脑皮层的分割方法

【翻译】GPT-3是如何工作的

论文笔记:TEACHTEXT: CrossModal Generaliz

python从零学（六）

详解Python 3.x 导入(import)

【答读者问27】backtrader不支持最新版本的

加:2021-08-19 12:04:06 更:2021-08-19 12:06:37

360图书馆购物三丰科技阅读网日历万年历 2026年4日历

-2026/4/22 20:05:13-

图片自动播放器
↓图片自动播放器↓

TxT小说阅读器
↓语音阅读,小说下载,古典文学↓

一键清除垃圾
↓轻轻一点,清除系统垃圾↓

图片批量下载器
↓批量下载图片,美女图库↓

网站联系: qq:121756557 email:121756557@qq.com IT数码