LLM-Aided OCR

LLM-Aided OCR

需求人群

目标受众为需要将扫描文档转换为可编辑和准确文本格式的个人或企业,如文档数字化、历史文档恢复、学术研究等。

使用场景

将历史信件的扫描件转换为可编辑的文本格式。对学术文章的扫描副本进行OCR处理,并纠正原始输出中的错误。将公司存档的合同文档数字化,以便于搜索和引用。

产品特色

PDF到图像转换使用Tesseract进行OCR使用LLMs进行高级错误校正(本地或基于API)智能文本分块以高效处理Markdown格式选项可选的页眉和页码抑制最终输出的质量评估支持本地LLMs和基于云的API提供商(OpenAI, Anthropic)异步处理以提高性能详细的日志记录用于过程跟踪和调试GPU加速本地LLM推理

使用教程

        11. 将PDF文件放置在项目目录中。
              22. 更新main()函数中的input_pdf_file_path变量为您的PDF文件名。
                    33. 运行脚本:python llm_aided_ocr.py。
                          44. 脚本将生成多个输出文件,包括最终处理后的文本。
                                55. 检查生成的{base_name}__raw_ocr_output.txt文件,这是Tesseract的原始OCR输出。
                                      66. 查看{base_name}_llm_corrected.md文件,这是经过LLM校正和格式化的最终文本。
                                            77. 根据需要,查看日志文件以了解处理过程和质量评估。

团队介绍

了解 LLM-Aided OCR 背后的团队成员,包括创始人、开发人员、设计师和产品人员。

该产品暂无团队信息。

  • 0 关注
  • 0 收藏,39 浏览
  • admin 提出于 2025-09-23 11:24

相关MCP客户端

相关教程