应用错误收集

时间：2017-08-26 04:29:45

标签： gpu nvidia tensorflow-gpu cudnn theano-cuda

当训练两个不同的神经网络中的一个时，一个用Tensorflow，另一个用Theano，有时候经过一段随机的时间（可能是几个小时或几分钟，大多数几个小时），执行冻结，我得到通过运行＆＃34; nvidia-smi＆＃34;：

来传达此消息

＆＃34;无法确定GPU 0000：02：00.0的设备句柄：GPU丢失。重新启动系统以恢复此GPU＆＃34;

我试图监控GPU性能，执行13个小时，一切看起来都很稳定：

我正在使用：

我不确定如何解决这个问题，任何人都可以提出可能导致此问题的建议，以及如何诊断/解决此问题？

答案 0 :(得分：2)

不久前我发布了这个问题，但是经过几周的调查，我们设法找到了问题（和解决方案）。我现在不记得所有的细节了，但是我发布了我们的主要结论，以防有人发现它有用。

最重要的是-我们拥有的硬件不足以支持高负载GPU-CPU通信。我们在具有1个CPU和4个GPU设备的机架服务器上观察到了这些问题，PCI总线上只是出现了过载。通过向机架服务器添加另一个CPU解决了该问题。