Evaluation KI-basierter Lösungen zur Extraktion von Informationen aus Diagrammen

Authors

  • Mirko Sprcic TH Mittelhesssen
  • Harald Ritz TH Mittelhessen
  • Frank Kammer TH Mittelhesssen

DOI:

https://doi.org/10.26034/lu.akwi.2026.8599

Keywords:

Informationsextraktion, Künstliche Intelligenz, Deep-Learning, Computer Vision, Convolutional Neural Networks, Vision Transformer, Objekterkennung, Linienextraktion, Optical Character Recognition, YOLO, PyTorch, HuggingFace

Abstract

Neben der Informationsextraktion aus unstrukturierten Daten  werden zunehmend Inhalte aus Bildern/Diagrammen verarbeitet. Ein Anwendungsfall existiert im Hochschulkontext bei Studierenden-Abgaben. Im Rahmen einer konzipierten Pipeline werden Deep-Learning-Modelle eingesetzt, die für Aufgaben wie Bildklassifizierung oder Objekterkennung optimiert sind. Die entwickelte Pipeline besteht aus fünf Prozessschritten, die und deren Ergebnisse vorgestellt werden.

References

Charles, P. K. et al. (2012): A Review on the Various Techniques used for Optical Character Recognition. In: International Journal of Engineering Research and Applications 2 (1), S. 659–662.

Choi, J. et al. (2019): Visualizing for the Non‐Visual: Enabling the Visually Impaired to Use Visualization. In: Computer Graphics Forum 38 (3), S. 249–260. DOI: 10.1111/cgf.13686.

Cowie, J.; Lehnert, W. (1996): Information extraction. In: Commun. ACM 39 (1), S. 80–91. DOI: 10.1145/234173.234209.

Davila, K. et al. (2021): ICPR 2020 - Competition on Harvesting Raw Tables from Infographics. In: Pattern Recognition. ICPR International Workshops and Challenges 12668, S. 361–380. DOI: 10.1007/978-3-030-68793-9_27.

Dosovitskiy, A. et al. (2020): An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. Online verfügbar unter http://arxiv.org/pdf/2010.11929v2.

Liu, F. et al. (2023): DePlot: One-shot visual language reasoning by plot-to-table translation. In: Findings of the Association for Computational Linguistics: ACL 2023, S. 10381–10399. DOI: 10.18653/v1/2023.findings-acl.660.

Luo, J. et al. (2021): ChartOCR: Data Extraction from Charts Images via a Deep Hybrid Framework. In: 2021 IEEE Winter Conference on Applications of Computer Vision (WACV), S. 1916–1924. DOI: 10.1109/WACV48630.2021.00196.

Maheshwari, K. et al. (2020): Convolutional Neural Networks: A Bottom-Up Approach. In: Deep Learning: De Gruyter, S. 21–50. DOI: 10.1515/9783110670905-002.

Masry, A. et al. (2023): UniChart: A Universal Vision-language Pretrained Model for Chart Comprehension and Reasoning. In: Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, S. 14662–14684. DOI: 10.18653/v1/2023.emnlp-main.906.

Mustafa, O. et al. (2023): ChartEye: A Deep Learning Framework for Chart Information Extraction. In: 2023 International Conference on Digital Image Computing: Techniques and Applications (DICTA), S. 554– 561. DOI: 10.1109/DICTA60407.2023.00082.

Wang, H. et al. (2023): Pre-Trained Language Models and Their Applications. In: Engineering 25, S. 51–65. DOI: 10.1016/j.eng.2022.04.024.

Zhang, H. et al. (2013): Text extraction from natural scene image: A survey. In: Neurocomputing 122, S. 310–323. DOI: 10.1016/j.neucom.2013.05.037.

Downloads

Published

2026-09-02

Issue

Section

Theses