强化学习用于路径规划,以Q-learning解决TSP问题为例

以下为原创代码,这段代码解决的是TSP问题,采用的思路是强化学习的Q-learning方法。
import numpy as np
epsilon = 0.5
gamma = 0.98
lr = 0.1
distance =np.array([[0,7,6,1,3],[7,0,3,7,8],[6,3,0,12,11],[1,7,12,0,2],[3,8,11,2,0]])
R_table = 11-distance
space = [0,1,2,3,4]
Q_table = np.zeros((5,5))
for i in range(10):
path = [0]
for j in range(4):
#print(path)
s = list(path)[j]
s_row = Q_table[s]
remain = set(space)-set(path)
maxvalue = -1000
for rm in remain:
Q
= Qtable[s, rm]
if Q
>max_value:
maxvalue = Q
a = rm
if np.random.uniform()<epsilon:
a = np.random.choice(np.array(list(set(space)-set(path))))
if j!=3:
Q_table[s,a] = (1-lr)Q_table[s,a]+lr(R_table[s,a]+gammamax_value)
else:
Q_table[s,a] = (1-lr)
Q_table[s,a]+lrR_table[s,a]
path.append(a)
Q_table[a,0] = (1-lr)
Q_table[a,0]+lr*R_table[a,0]
path.append(0)
print(Q_table)
#即可得到最佳的TSP路径的Q表

转载于:https://blog.51cto.com/14213209/2354227

  • 3
    点赞
  • 42
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值