返回

14毕业论文:脱机汉字识别的研究 14毕业论文:脱机汉字识别的研究

格式:word 上传:2026-07-18 19:39:51
温馨提示:手指轻点页面,可唤醒全屏阅读模式,左右滑动可以翻页。
毕业论文:脱机汉字识别的研究.doc预览图(1)
1 页 / 共 58
毕业论文:脱机汉字识别的研究.doc预览图(2)
2 页 / 共 58
毕业论文:脱机汉字识别的研究.doc预览图(3)
3 页 / 共 58
毕业论文:脱机汉字识别的研究.doc预览图(4)
4 页 / 共 58
毕业论文:脱机汉字识别的研究.doc预览图(5)
5 页 / 共 58
毕业论文:脱机汉字识别的研究.doc预览图(6)
6 页 / 共 58
毕业论文:脱机汉字识别的研究.doc预览图(7)
7 页 / 共 58
毕业论文:脱机汉字识别的研究.doc预览图(8)
8 页 / 共 58
毕业论文:脱机汉字识别的研究.doc预览图(9)
9 页 / 共 58
毕业论文:脱机汉字识别的研究.doc预览图(10)
10 页 / 共 58
毕业论文:脱机汉字识别的研究.doc预览图(11)
11 页 / 共 58
毕业论文:脱机汉字识别的研究.doc预览图(12)
12 页 / 共 58
毕业论文:脱机汉字识别的研究.doc预览图(13)
13 页 / 共 58
毕业论文:脱机汉字识别的研究.doc预览图(14)
14 页 / 共 58
毕业论文:脱机汉字识别的研究.doc预览图(15)
15 页 / 共 58
预览结束,还剩 43 页未读
阅读全文需用电脑访问
温馨提示 电脑下载 投诉举报

1、手机端页面文档仅支持阅读 15 页,超过 15 页的文档需使用电脑才能全文阅读。

2、下载的内容跟在线预览是一致的,下载后除PDF外均可任意编辑、修改。

3、所有文档均不包含其他附件,文中所提的附件、附录,在线看不到的下载也不会有。

如果为,左边右边两列中有列全为,另列至多有两个,那么或者是端点或者删除会破坏黑像素连通性,不能删除如果为,和为,或为,则删除会破坏黑像素连通性,不能删除如果和为,那么或者是被包围的像素,或者删除后会破坏黑像素的连通性,不能删除如果和为,那么或者是被包围的像素,或者删除后会破坏黑像素的连通性,不能删除否则可删除。


这是为的情况,对于为的情况,只需将其旋转就可得到删除条件。


细化算法如下做如下循环从图像开始遍历每个像素,若为,为,根据上面所述条件判断其是否应被删除,若应该删除,将其标记,遍历完后在原图像中将标记应被删除的改为从图像开始遍历每个像素,若为,为,根据类似上面所述条件判断其是否应被删除,若应该删除,将其标记,遍历完后在原图像中将标记应或为,则删除会破坏黑像素连通性,不能删除如果和为,那么或者是被包围的像素,或者删除后会破坏黑像素的连通性,不能删除如果和为,那么或者是被包围的像素,或者删除后会破坏黑至少有个像素为,此时若删除,将破坏黑像素的连通性,因此不能删如果为,左边右边两列中有列全为,另列至多有两个,那么或者是端点或者删除会破坏黑像素连通性,不能删除如果为,和为,地位相同,这里只讨论为的情况。


如果与相邻的八个像素至多有个黑像素,则是线段的端点,不能删除如果也为,同时左边那列至少有个像素为,右面那列素的字母代号如上图,为待处理的像素,其余八个像素是与相邻的像素,它们的代号见图中的字母。


如果为,则其不是黑像素,不用处理。


如果为,有个是,则是边界点,考虑其能否被删除。


又因为到得到保持原物体拓扑结构的单像素宽的线。


细化的关键在于寻找可以删除的黑像素处在边界上且删除后不会改变物体拓扑结构的黑像素可以删除。


我通过分析,找到了如下的条件图五相邻像响。


不同人写的同个字提取出的特征应该尽可能相同,但不同人写的字粗细不同,同个字内部笔画的粗细也会有不同,这些不同会影响提取出的特征。


细化的思路是反复遍历图像,删除处在边界上的满足条件的黑像素,直不同的特征提取方法需要的归化预处理是不同的,下面先将不同的归化预处理方法给出,第部分汉字特征提取将比较这些归化预处理在不同的特征提取方法中使用的效果。


细化细化的目的是为减少笔画粗细对汉字特征的影后的图像。


图手写汉字图像图二中值滤波后的图像图三未滤波直接细化的结果图四中值滤波后细化的结果归化预处理归化预处理的目的是减少不同人写的字的差异,使不同风格的同个汉字能提取出相近的特征。


细化的汉字骨架就少了这样的毛刺笔画。


中值滤波确能很好地去除汉字图像的噪音,包括笔画边缘的毛刺,复杂度又极低,因此中值滤波器可以作为汉字图像噪声去除的好算法。


下面的实验使用的汉字图像都是经过中值滤波处理波就直接细化的结果,图四是滤波后再细化的结果。


可以看到不滤波就直接细化的汉字骨架上有不少多余的短笔画,这是由于原汉字的毛刺造成的,这些多余的毛刺或者笔画中的空洞在细化后就会形成多余的短笔画,而滤波后再若固定,例如,则固定,此算法复杂度为常数。


图是手写汉字的图像,每个字大小是像素。


图二是用上述中值滤波器对其滤波的结果。


可以看到,滤波后汉字的边缘光滑多了,些多余的噪声点也去除了。


图三是没有滤这个像素为黑像素,否则为白像素。


这是因为对二值图像的九个像素排序后,排在中间的像素为黑像素当且仅当九个像素中黑像素的总数大于或等于。


此算法的复杂度为,为图像的像素总数。


每个单字的图像像素中间的像素的灰度值作输出图像的这个像素的灰度。


将其用于对汉字二值图像滤波,可以得到很简单的不需要排序的算法遍历图像的每个像素,计算它和与它相邻的八个像素中黑像素的个数,如果大于或等于,则输出图像的其识别。


对噪声的去除是很重要的预处理过程。


中值滤波器具有能有效去除数字图像的噪声而又不会使图像中物体边界模糊的特点。


它的般算法为遍历图像的每个像素,将它和与它相邻的八个像素的灰度排序,取排在适用于汉字特征的比较,只要两种特征的维数相同。


噪声去除手写的汉字会因墨与纸的关系而出现毛刺,也就是笔画边缘凹凸不平,而且笔画内部也会有空洞,这些与汉字无关的噪声如果不去除,会影响特征的提取,进而影响对通过整个识别过程得到的正确识别率来比较,这时两种特征下的分类器因为特征的维数不同结构会显著不同了,这样得到的结果严格来说是特征加上此特征下的分类器共同作用下的结果。


方差比是般的特征优劣量度方法,不仅这个距离的平方是与矢量的维数有关的,是每维距离的平方的和,维数越多,求和项越多,也就是说维数越多,方差的值趋于越大,因此,这种方法只适应于比较两种维数相同的特征的优劣。


对于维数不同的特征,仍然需要通这个距离的平方是与矢量的维数有关的,是每维距离的平方的和,维数越多,求和项越多,也就是说维数越多,方差的值趋于越大,因此,这种方法只适应于比较两种维数相同的特征的优劣。


对于维数不同的特征,仍然需要通过整个识别过程得到的正确识别率来比较,这时两种特征下的分类器因为特征的维数不同结构会显著不同了,这样得到的结果严格来说是特征加上此特征下的分类器共同作用下的结果。


方差比是般的特征优劣量度方法,不仅适用于汉字特征的比较,只要两种特征的维数相同。


噪声去除手写的汉字会因墨与纸的关系而出现毛刺,也就是笔画边缘凹凸不平,而且笔画内部也会有空洞,这些与汉字无关的噪声如果不去除,会影响特征的提取,进而影响对其识别。


对噪声的去除是很重要的预处理过程。


中值滤波器具有能有效去除数字图像的噪声而又不会使图像中物体边界模糊的特点。


它的般算法为遍历图像的每个像素,将它和与它相邻的八个像素的灰度排序,取排在中间的像素的灰度值作输出图像的这个像素的灰度。


将其用于对汉字二值图像滤波,可以得到很简单的不需要排序的算法遍历图像的每个像素,计算它和与它相邻的八个像素中黑像素的个数,如果大于或等于,则输出图像的这个像素为黑像素,否则为白像素。


这是因为对二值图像的九个像素排序后,排在中间的像素为黑像素当且仅当九个像素中黑像素的总数大于或等于。


此算法的复杂度为,为图像的像素总数。


每个单字的图像像素若固定,例如,则固定,此算法复杂度为常数。


图是手写汉字的图像,每个字大小是像素。


图二是用上述中值滤波器对其滤波的结果。


可以看到,滤波后汉字的边缘光滑多了,些多余的噪声点也去除了。


图三是没有滤波就直接细化的结果,图四是滤波后再细化的结果。


可以看到不滤波就直接细化的汉字骨架上有不少多余的短笔画,这是由于原汉字的毛刺造成的,这些多余的毛刺或者笔画中的空洞在细化后就会形成多余的短笔画,而滤波后再细化的汉字骨架就少了这样的毛刺笔画。


中值滤波确能很好地去除汉字图像的噪音,包括笔画边缘的毛刺,复杂度又极低,因此中值滤波器可以作为汉字图像噪声去除的好算法。


下面的实验使用的汉字图像都是经过中值滤波处理后的图像。


图手写汉字图像图二中值滤波后的图像图三未滤波直接细化的结果图四中值滤波后细化的结果归化预处理归化预处理的目的是减少不同人写的字的差异,使不同风格的同个汉字能提取出相近的特征。


不同的特征提取方法需要的归化预处理是不同的,下面先将不同的归化预处理方法给出,第部分汉字特征提取将比较这些归化预处理在不同的特征提取方法中使用的效果。


细化细化的目的是为减少笔画粗细对汉字特征的影响。


不同人写的同个字提取出的特征应该尽可能相同,但不同人写的字粗细不同,同个字内部笔画的粗细也会有不同,这些不同会影响提取出的特征。


细化的思路是反复遍历图像,删除处在边界上的满足条件的黑像素,直到得到保持原物体拓扑结构的单像素宽的线。


细化的关键在于寻找可以删除的黑像素处在边界上且删除后不会改变物体拓扑结构的黑像素可以删除。


我通过分析,找到了如下的条件图五相邻像素的字母代号如上图,为待处理的像素,其余八个像素是与相邻的像素,它们的代号见图中的字母。


如果为,则其不是黑像素,不用处理。


如果为,有个是,则是边界点,考虑其能否被删除。


又因为地位相同,这里只讨论为的情况。


如果与相邻的八个像素至多有个黑像素,则是线段的端点,不能删除如果也为,同时左边那列至少有个像素为,右面那列至少有个像素为,此时若删除,将破坏黑像素的连通性,因此不能删如果为,左边右边两列中有列全为,另列至多有两个,那么或者是端点或者删除会破坏黑像素连通性,不能删除如果为,和为,或为,则删除会破坏黑像素连通性,不能删除如果和为,那么或者是被包围的像素,或者删除后会破坏黑像素的连通性,不能删除如果和为,那么或者是被包围的像素,或者删除后会破坏黑像素的连通性,不能删除否则可删除。


这是为的情况,对于为的情况,只需将其旋转就可得到删除条件。


细化算法如下做如下循环从图像开始遍历每个像素,若为,为,根据上面所述条件判断其是否应被删除,若应该删除,将其标记,遍历完后在原图像中将标记应被删除的改为从图像开始遍历每个像素,若为,为,根据类似上面所述条件判断其是否应被删除,若应该删除,将其标记,遍历完后在原图像中将标记应被删除的改为从图像开始遍历每个像素,若为,为,根据类似上面所述条件判断其是否应被删除,若应该删除,将其标记,遍历完后在原图像中将标记应被删除的改为从图像开始遍历每个像素,若为,为,根据类似上面所述条件判断其是否应被删除,若应该删除,将其标记,遍历完后在原图像中将标记应被删除的改为直到没有黑像素被删除为止,退出循环。


每个循环都对图像做四次遍历,这是因为如果四个方向的边界都在同次遍历中细化会导致在物体拐角处出现多余毛刺边,所以我分四次遍历,每次删除个方向的边界。


这个算法的复杂度为。


汉字分解采用边缘梯度方向角分解,有四种边缘梯度方向角分解方法,由于它们性能差不多,我就使用边缘梯度方向角分解算法。


汉字样本使用上面用过的三套手写汉字和四套印刷体汉字

下一篇
  • Hi,我是你的文档小助手!
    你可以按格式查找相似内容哟
DOC PPT RAR 精品 全部
小贴士:
  • 🔯 当前文档为word文档,建议你点击DOC查看当前文档的相似文档。
  • ⭐ 查询的内容是以当前文档的标题进行精准匹配找到的结果,如果你对结果不满意,可以在顶部的搜索输入框输入关健词进行。
帮帮文库-精品文档 帮帮文库-免费阅读 帮帮文库-海量资源
换一批

搜索

客服

足迹

下载文档