强化学习Q-learning解决TSP

最新推荐文章于 2024-01-12 02:00:00 发布

识堂干饭BOSS高

最新推荐文章于 2024-01-12 02:00:00 发布

阅读量2.5k

点赞数 1

分类专栏： TSP 文章标签： tsp 强化学习

本文链接：https://blog.csdn.net/sir927/article/details/115099147

版权

强化学习 Q-learning 旅行商问题路径优化算法

关键词由CSDN通过智能技术生成

TSP 专栏收录该内容

2 篇文章 0 订阅

订阅专栏

以下这段代码解决TSP问题，采用的思路是强化学习的Q-learning方法


import numpy as np
epsilon = 0.5
gamma = 0.98
lr = 0.1
distance =np.array([[0,7,6,1,3],[7,0,3,7,8],[6,3,0,12,11],[1,7,12,0,2],[3,8,11,2,0]])
R_table = 11-distance
space = [0,1,2,3,4]
Q_table = np.zeros((5,5))
for i in range(10):
path = [0]
for j in range(4):
#print(path)
s = list(path)[j]
s_row = Q_table[s]
remain = set(space)-set(path)
maxvalue = -1000
for rm in remain:
Q = Qtable[s, rm]
if Q>max_value:
maxvalue = Q
a = rm
if np.random.uniform()<epsilon:
a = np.random.choice(np.array(list(set(space)-set(path))))
if j!=3:
Q_table[s,a] = (1-lr)Q_table[s,a]+lr(R_table[s,a]+gammamax_value)
else:
Q_table[s,a] = (1-lr)Q_table[s,a]+lrR_table[s,a]
path.append(a)
Q_table[a,0] = (1-lr)Q_table[a,0]+lr*R_table[a,0]
path.append(0)
print(Q_table)
//即可得到最佳的TSP路径的Q表</epsilon