Skip to content

dikers/ocr_synth_text_chinese

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

18 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

OCR 识别

通过生成各种字体的文本,自动生成中文手写体图片,并做了数据增强,用于文本区域检测算法训练。

建立环境

conda create -n  ocr-cn python=3.6 pip scipy numpy ##运用conda 创建python环境
source activate ocr-cn
pip install -r requirements.txt -i https://mirrors.163.com/pypi/simple/

字符串切割

sh split_text/split_text.sh split_text/sample_data/test.txt   

可以根据实际需要 替换自己生成数据的文本内容

生成合成图片

python3 synth_image/run.py -c 3 --font_dir synth_image/fonts/cn -i dataset/text_split.txt -lc 50
python3 synth_image/run.py -c 20 --font synth_image/fonts/cn/仿宋_GB2312.ttf -i dataset/text_split_en.txt -lc 10 --output_dir ~/datasets/en_20


#  -c               生成数据的数量
#  --font_dir       字体文件夹
#  -lc              每张图片最多的字符串数量 

可以根据实际需要 选择字体文件

参考内容

示例图片

image

image

image

About

生成训练文本检测数据集

Resources

License

Stars

12 stars

Watchers

1 watching

Forks

Releases

No releases published

Packages

 
 
 

Contributors