티스토리 뷰
지난 금요일(3월 13일)에 OCR 판독 앱을 하나 시범으로 만들기로 하고 이번주부터 진행하고 있습니다.
월요일 3월 16일부터 준비하여 오늘 3월 18일까지 80퍼센트 정도 완성했습니다.
주 메뉴는 '손글씨, PDF, 이미지' 이렇게 세 가지입니다
'손글씨'는 하위 메뉴가 없고 'PDF'의 하위 메뉴는 '전체, 테이블, 이미지(그래프, 사진)' 입니다.
'이미지'의 하위 메뉴는 '식품라벨, 신분증, 사업자등록증, 기타'입니다. 신분증은 탭으로 '주민등록증, 운전면허증, 여권'으로 나눴습니다.
'손글씨'는 그냥 이미지 파일에 있는 텍스트를 추출하여 결과를 보여줍니다.
'PDF'는 pdf 파일을 읽어들여 텍스트, 테이블, 이미지(그래프, 사진) 등을 보여주는 형태입니다.
테이블은 잘 작성해주지만 셀 병합된 테이블은 아직 제대로 작성되지 않습니다.
이미지(그래프, 사진)를 추출하는 것은 아직 방법을 찾지 못했습니다.
'이미지'는 좀 상세하게 설명합니다.
'식품라벨'은 식품라벨에 있는 텍스트 중 영양성분만 테이블로 보여주고 csv(또는 엑셀)로 저장합니다. 테이블의 항목을 클릭하면 해당 식품라벨의 결과 이미지를 보여주도록 하였습니다.
'신분증'은 주민등록증, 운전면허증, 여권에서 얻을 수 있는 정보를 식품 라벨과 같은 형태로 보여줍니다.
'사업자등록증, 기타'는 아직 결정되지 않아 작성하지 않았습니다.
'이력서'를 검토할 수도 있습니다. 이 부분은 앞으로 방향이 정해지면 진행할 예정입니다.
단계는 크게 두 단계로 진행했습니다.
첫번째. OCR을 통해 텍스트를 읽습니다.
두번째. 이 텍스트를 LLM을 통해 적절히 필요한 값들을 찾아서 결과로 보여줍니다.
OCR은 마이크로소프트의 Azure Vision의 OCR 툴을 사용했습니다.
EasyOCR은 Azure Vision에 비해 속도도 느리고 성능도 좋지않아서 Azure를 이용했습니다.
그 결과 이미지를 몇 개 첨부합니다.
문제점들을 먼저 해결하고 멀티모달을 통한 결과까지 진행해보고자 합니다.



'machineLearning > GPT' 카테고리의 다른 글
| Agentic Graph RAG (0) | 2026.03.30 |
|---|---|
| MCP 에이전트 구현 (0) | 2026.03.25 |
| 보고서 작성 앱 (1) | 2025.09.26 |
| LLM으로 테이블 만들기 (4) | 2025.08.28 |
| 그래프 그리기 (3) | 2025.08.26 |
- Total
- Today
- Yesterday
- prompt
- 고등학교 수학
- FewShot
- 미분계수
- 미분법
- 암석역학
- Python
- AI_고교수학
- 챗봇
- Chatbot
- 약수
- 프로그래머스
- RockMechanics
- LLM
- 변화율
- 파이썬
- 텐서플로우
- checkpoint
- 미분
- ChatGPT
- LangChain
- streamlit
- GPT
- programmers.co.kr
- RAG
- 도함수
- programmers
- 로피탈정리
- 랭체인
- TensorFlow
| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | ||||
| 4 | 5 | 6 | 7 | 8 | 9 | 10 |
| 11 | 12 | 13 | 14 | 15 | 16 | 17 |
| 18 | 19 | 20 | 21 | 22 | 23 | 24 |
| 25 | 26 | 27 | 28 | 29 | 30 | 31 |