如何解决loss NAN的问题

2019-04-13 18:24 zYaMei 阅读(7718) 评论(0) 收藏举报

问题

　　如上图所示，第二次迭代时出现NAN值，nan表示无穷大或者非数值，一般是在一个数除以0或者log(0)时会出现无穷大。可能的原因有：1）学习率过大；2）batch过大；3）不当的损失函数等。

　　试着将学习率和batch分别调低，但还是会出现nan，说明不是学习率和batch的问题。

定位loss NAN的方法

　　使用tensorflow的代码调试模块tfdbg，可以看到运行tensorflow graph时的内部结构体和状态，方便排查变量出现NAN、inf的情况。tfdbg的官方文档介绍 https://www.tensorflow.org/versions/master/how_tos/debugger/

　　使用过滤器可以帮助查找异常值，命令：run -f has_inf_or_nan。如下图所示，在第一行中has_inf_or_nan过滤器在第一次Session.run调用期间第一次被触发。第一个出现异常值的tensor是计算欧式距离的tensor。