文档格式 【34页】毕业论文_生产加工站优化控制仿真演示系统.doc源文档全文在线看 ㊣ 精品文档 值得下载

🔯 格式:DOC | ❒ 页数:34 页 | ⭐收藏:0人 | ✔ 可以修改 | @ 版权投诉 | ❤️ 我的浏览 | 上传时间:2026-07-12 05:04
【34页】毕业论文_生产加工站优化控制仿真演示系统.doc源文档全文在线看第1页
1 页 / 共 34
【34页】毕业论文_生产加工站优化控制仿真演示系统.doc源文档全文在线看第2页
2 页 / 共 34
【34页】毕业论文_生产加工站优化控制仿真演示系统.doc源文档全文在线看第3页
3 页 / 共 34
【34页】毕业论文_生产加工站优化控制仿真演示系统.doc源文档全文在线看第4页
4 页 / 共 34
【34页】毕业论文_生产加工站优化控制仿真演示系统.doc源文档全文在线看第5页
5 页 / 共 34
【34页】毕业论文_生产加工站优化控制仿真演示系统.doc源文档全文在线看第6页
6 页 / 共 34
【34页】毕业论文_生产加工站优化控制仿真演示系统.doc源文档全文在线看第7页
7 页 / 共 34
【34页】毕业论文_生产加工站优化控制仿真演示系统.doc源文档全文在线看第8页
8 页 / 共 34
【34页】毕业论文_生产加工站优化控制仿真演示系统.doc源文档全文在线看第9页
9 页 / 共 34
【34页】毕业论文_生产加工站优化控制仿真演示系统.doc源文档全文在线看第10页
10 页 / 共 34
【34页】毕业论文_生产加工站优化控制仿真演示系统.doc源文档全文在线看第11页
11 页 / 共 34
【34页】毕业论文_生产加工站优化控制仿真演示系统.doc源文档全文在线看第12页
12 页 / 共 34
【34页】毕业论文_生产加工站优化控制仿真演示系统.doc源文档全文在线看第13页
13 页 / 共 34
【34页】毕业论文_生产加工站优化控制仿真演示系统.doc源文档全文在线看第14页
14 页 / 共 34
【34页】毕业论文_生产加工站优化控制仿真演示系统.doc源文档全文在线看第15页
15 页 / 共 34
温馨提示

1、该文档不包含其他附件(如表格、图纸),本站只保证下载后内容跟在线阅读一样,不确保内容完整性,请务必认真阅读。

2、有的文档阅读时显示本站(www.woc88.com)水印的,下载后是没有本站水印的(仅在线阅读显示),请放心下载。

3、除PDF格式下载后需转换成word才能编辑,其他下载后均可以随意编辑、修改、打印。

4、有的标题标有”最新”、多篇,实质内容并不相符,下载内容以在线阅读为准,请认真阅读全文再下载。

5、该文档为会员上传,下载所得收益全部归上传者所有,若您对文档版权有异议,可联系客服认领,既往收入全部归您。

理率最大本文首先根据多系统的反应扩散思想,对每个的原始性能函数进行改进,引入了具有扩散功能的局域信息交互项原始项看作具有反应功能并运用性能势理论,构建种适用于平均和折扣两种性能准则的多学习算法,以求解决策时刻不同步的多站点的协作控制策略最后,论文通过仿真实验验证了该算法的有效性,学习结果表明,通过性能函数的改进,各工作站的负载平衡性得到改善,整个系统的工件处理率也明显提高关键词传送带给料生产加工站,控制,多强化学习,性能函数,生产加工站优化控制仿真演示系统摘要图表清单第章绪论相关背景开发环境旗舰版第二章基于多站点系统的算法的实现强化学习学习算法孤立决策学习算法代价函数算法思想基于性能势的多站点学习算法第三章系统仿真设计实现与分析与混合编程模块设计与实现系统参数设置模块算法参数设置模块学习优化模块第六章总结与展望本文工作对未来的展望参考文献致谢附录代码部分算法仿真部分代码图表清单图多站点系统物理模型图文件的编写和编译图在控件中显示绘制的图形图参数设置界面图算法参数设置界面图运行中时刻各缓冲库的使用情况图优化仿真运行中图系统总处理率图各站点负载率图系统总平均折扣代价图系统总平均折扣代价图孤立决策算法负载率图孤立决策算法系统平均折扣代价图孤立决策算法各站点平均折扣代价图孤立决策算法系统总处理率第章绪论相关背景随着社会进步和高新技术发展,现代生产加工企业越来越往专业化智能化规模化和集约化方向发展,涌现出类由生产加工站作为加工主体的生产线,例如先进制造业中的些机器人装配线,其中,加工站由传送带输送工件加工,这样的类系统统称为传送带给料生产加工站,。


图多站点系统物理模型的优化控制问题,源于汽车装配线,系统配置和般工作模式是,加工站配有传感器,可前视或检测前方定长度内传送带上工件的位置信息,并根据当前加工站的状态信息,决定是否等待并捡取工件放置到有限容量的缓存库,或直接从缓存库取出工件进行加工,加工完的工件放置到假设容量无穷大的库区。


优化控制问题就是如何根据缓存库的状态信息决定对应的距离,使系统的长期运行代价准则值最小或系统的工件处理率最大。


开发环境旗舰版是微软公司推出的开发环境。


是目前最流行的平台应用程序开发环境。


同时带来了,并且支持开发面向的应用程序。


除了,它还支持和数据库。


在功能上,旗舰版新添以下九个功能中的动态类型和动态编程多显示器支持使用的特性支持支持特性新特性增强使用创建界面新增基于平台的语言采用拖曳式便能完成软件的开发。


简简单单的操作便可以实现个界面的生成。


但拖曳的界面,也应当有相应的代码来实现功能。


支持。


可以快速实现相应的功能。


这样的设计使得开发人员专注于后台算法逻辑的分析与实现,提高开发效率。


为的缩写,意思是基于的图形界面处理,其原来代号为,因我佩服拼音首字母组合样,国内有人调侃地称之为我佩服。


由开始引入,与及并行为新代操作系统以及的三个重大应用程序开发类库。


是微软新代图形系统,运行在架构下,为用户界面图形文档和媒体提供了统的描述和操作方法。


基于技术的不仅带来了前所未有的界面,而且其图形向量渲染引擎也大大改进了传统的界面,比如中的半透明效果的窗体等都得益于。


程序员在的帮助下,要开发出媲美程序的酷炫界面已不再是遥不可及的奢望。


相对于客户端的开发来说,向前跨出了巨大的步,它提供了超丰富的框架,集成了矢量图形,丰富的流动文字支持,视觉效果和强大无比的控件模型框架。


第二章基于多站点系统的算法的实现以系统为研究对象,分别以单站点的半算法基于遗传算法及其改进算法的多站点的控制策略算法学习算法以及基于性能势理论的模型无关多学习算法等为核心,进行系统的可视化仿真模拟。


强化学习在强化学习中,学习主体自身通过训练误差和反馈,学习在环境中完成目标的最佳策略。


我们并没有直接告诉主体要做什么或采取那个动作,而是主体通过看那个动作得到了最多的奖励来自己发现。


强化学习由四部分组成策略奖励函数值映射和个环境模型。


设计强化学习算法时要考虑三方面问题如何表示状态空间和动作空间如何选择建立信号以及如何通过学习来修正不同状态动作对的值如何根据这些值来选择适合的动作。


用强化学习方法研究未知环境下的机器人导航,由于环境的复杂性和不确定性,这些问题变得更复杂。


所谓强化学习是指从环境状态到动作映射的学习,以使动作从环境中获得的累积奖赏值最大该方法不同于监督学习技术那样通过正例反例来告知采取何种行为,而是通过试错来发现最优行为策略。


常用的强化学习算法包括算法学习算法算法等。


标准的强化学习,智能体作为学习系统,获取外部环境的当前状态信息,对环境采取试探行为,并获取环境反馈的对此动作的评价和新的环境状态。


如果智能体的动作导致环境正的奖赏立即报酬,那么智能体以后产生这个动作的趋势便会加强反之,智能体产生这个动作的趋势将减弱。


在学习系统的控制行为与环境反馈的状态及评价的反复的交互作用中,以学习的方式不断修改从状态到动作的映射策略,以达到优化系统性能目的。


据此可得出强化学习的目标是学习从环境状态到行为的映射,使得智能体选择的行为能够获得环境最大的奖赏,使得外部环境对学习系统在种意义下的评价或整个系统的运行性能最佳学习算法学习是由提出的种模型无关的强化学习算法,主要求解马尔可夫决策过程环境模型下的学习问题。


下面首先给出模型的定义,然后介绍学习的原理。


定义模型可以定义为个五元组。


其中,为状态集合,为动作集合,为回报函数,为状态转移概率,其中表示从状态执行动作转移到状态的概率。


为值函数,对于无限阶段折扣模型,状态的值函数定义为定义的策略定义为从状态空间到动作空间上的概率分布的个映射,即兀,其中为动作空间上的概率分布。


强化学习的目标是学习个最优策略,使得,其中,为策略下状态的值函数。


强化学习过程由情节和步骤组成,其中步骤是指个确定的状态及该状态下的动作执行和报酬获得,情节是指从起始状态到目标状态的步骤的序列。


为了与后面算法中的步骤相区分,将强化学习中的步骤称为是步骤。


假定在起始步骤状态为,智能体执行动作后得到回报,并且状态转移到,那么值函数定义为,若记最优值函数为,则由最优性原理可得,。


记,表示在状态执行动作且以后遵循策略的期望折扣回报。


记最优策略下的值为,,则,。


若记,,那么最优策略即为。


根据下面的迭代公式求解并且当值函数采用表存储时,该迭代过程能够确保值函数以概率收敛到最优值函数。


,,如果且其他情况孤立决策学习算法顾名思义,该算法在学习时各站点间保持相对孤立,也就是不考虑相互的影响,各自决策。


代价函数如果在单位时间内的等待时间越短,则其单位时间内的加工时间就相对越长,我们可以期望加工工件的个数就越多,则系统的处理率便会越高。


因此可以定义为单位等待时间的代价且记为在状态下采取行动转移到下状态前的单位时间代价,则当即从传送带上取工件放入缓冲库时否则若若其中,是到间的实际加工时间。


算法思想该算法类似于般的学习算法,因此就不多叙述了。


感觉上它就相当于单站点系统的简单叠加应用,因为各站点之间没有任何的信息交互,完全孤立的决策。


该算法的执行过程如下设置各站点的初始策略和所有状态行动对的值等信息,且时间从零开始每次更新时间时,顺序修改各站点的决策时刻信息,若需要决策,则根据策略规则选择当前状态下的行动执行,并计算此次状态转换的代价更新值和转换之前策略的状态的行动选择概率重复上述步骤,直至系统处理率等性能趋于稳定。


孤立决策学习算法的主要参数有三个,和。


其中为单位等待时间的代价已经在上小节介绍了,称作折扣因子,当时算法就在折扣准则下工作当时,算法则是在平均准则下工作了。


是个常数,它是学习步长的指数因子,决定着值更新的幅度。


基于性能势的多站点学习算法由前面介绍的多系统的物理模型可知,多个站点是串行分布在传送带沿线的,所以上游的站点总是具有优先捡取工件的机会,它的决策对下游站点的运行必然会产生影响的。


但是在没有信息交互的情况下,下游站点的决策对上游站点的影响未被考虑进去,这显然不利于站点间的相互协作和负载均衡,结果往往是上游站点的负荷过重而下游站点负荷太轻,严重影响了系统效率。


代价函数反应扩散方程是刻画多系统动态特性的个重要方法,它的主要思想是定义系统的能量函数与每个的模式及其与所有相邻的模式之差有关,前者是反应项,后者是扩散项,系统的动力学过程就是能量函数的动态衰减过程在多系统模型中,为体现各站点,特别是相邻站点之间的协作关系,可运用反应扩散思想,将与其下游相邻的进行信息交互,即将后者的状态信息通过代价函数反馈到前者作为影响其决策的参考因素。


由此,基于性能势的多学习算法在定义站点代价函数时增加了个反馈项局部信息交互项,将该站点的下游紧邻站点的缓冲库库存空余量与本站点的库存空余量之差作为本站点计算代价时的个考虑因子。


于是,对每个,其代价函数的定义是当时

下一篇
  • Hi,我是你的文档小助手!
    你可以按格式查找相似内容哟
筛选: 精品 DOC PPT RAR
小贴士:
  • 🔯 当前文档为word文档,建议你点击DOC查看当前文档的相似文档。
  • ⭐ 查询的内容是以当前文档的标题进行精准匹配找到的结果,如果你对结果不满意,可以在顶部的搜索输入框输入关健词进行。
帮帮文库-精品文档 帮帮文库-免费阅读 帮帮文库-海量资源
换一批