将带有文本（和图片）的图像文件分割成块答案

【问题标题】：Segmenting image files with text (and pictures) into blocks将带有文本（和图片）的图像文件分割成块
【发布时间】：2020-07-26 16:00:21
【问题描述】：

我正在尝试为我拥有的图像中的文本创建边界框。下面是一个例子。

我想在每个 This is a test 行周围添加一个边界框。不幸的是，我不确定为什么这种方法不能自动识别边界框

import re
import cv2
import numpy as np
import pytesseract
from pytesseract import Output
from matplotlib import pyplot as plt


# Plot character boxes on image using pytesseract.image_to_boxes() function
image = cv2.imread('Image.jpg')
b, g, r = cv2.split(image)
image = cv2.merge([r,g,b])
d = pytesseract.image_to_data(image, output_type=Output.DICT)
print('DATA KEYS: \n', d.keys())

n_boxes = len(d['text'])
for i in range(n_boxes):
    # condition to only pick boxes with a confidence > 60%
    if int(d['conf'][i]) > 60:
        (x, y, w, h) = (d['left'][i], d['top'][i], d['width'][i], d['height'][i])
        image = cv2.rectangle(image, (x, y), (x + w, y + h), (0, 255, 0), 2)

b, g, r = cv2.split(image)
rgb_img = cv2.merge([r, g, b])
plt.figure(figsize=(16, 12))
plt.imshow(rgb_img)
plt.title('SAMPLE IMAGE WITH WORD LEVEL BOXES')
plt.show()

【问题讨论】：

您有具体问题吗？一定有一百万个因素可能导致这种情况，不是吗？

标签： python opencv tesseract image-segmentation python-tesseract

【解决方案1】：

这是使用 Python/OpenCV 的另一种方法。

读取输入
转换为灰色
(OTSU) 阈值（黑底白字）
应用形态扩张，水平内核长于字母间距，然后使用较小的垂直内核，以删除页面中剩余的细水平线。
寻找轮廓
在输入上绘制轮廓边界框
保存结果

输入：

import cv2
import numpy as np

# load image
img = cv2.imread("test_text.jpg")

# convert to gray
gray = cv2.cvtColor(img, cv2.COLOR_BGR2GRAY)

# threshold the grayscale image
thresh = cv2.threshold(gray, 0, 255, cv2.THRESH_BINARY_INV + cv2.THRESH_OTSU)[1]

# use morphology erode to blur horizontally
#kernel = np.ones((500,3), np.uint8)
kernel = cv2.getStructuringElement(cv2.MORPH_RECT, (250, 3))
morph = cv2.morphologyEx(thresh, cv2.MORPH_DILATE, kernel)
kernel = cv2.getStructuringElement(cv2.MORPH_RECT, (3, 17))
morph = cv2.morphologyEx(morph, cv2.MORPH_OPEN, kernel)

# find contours
cntrs = cv2.findContours(morph, cv2.RETR_EXTERNAL, cv2.CHAIN_APPROX_SIMPLE)
cntrs = cntrs[0] if len(cntrs) == 2 else cntrs[1]

# Draw contours
result = img.copy()
for c in cntrs:
    x,y,w,h = cv2.boundingRect(c)
    cv2.rectangle(result, (x, y), (x+w, y+h), (0, 0, 255), 2)

# write result to disk
cv2.imwrite("test_text_threshold.png", thresh)
cv2.imwrite("test_text_morph.png", morph)
cv2.imwrite("test_text_lines.jpg", result)

cv2.imshow("GRAY", gray)
cv2.imshow("THRESH", thresh)
cv2.imshow("MORPH", morph)
cv2.imshow("RESULT", result)
cv2.waitKey(0)
cv2.destroyAllWindows()

阈值图像：

放大的图像：

结果：

【讨论】：

这正是我试图做的。你有更多的资源可以将图像分割成不同的部分吗？
不，没有更具体的。我不知道你的用例。但是请阅读docs.opencv.org/4.1.1 的 OpenCV 文档并搜索 Google。你会发现很多例子。