식약처·공공데이터 API로 임상시험을 수집해 DB와 엑셀로 넣고, 회차 간 변경을 뽑는다.
- 입력
- 식약처·공공데이터 API
- 출력
- 임상시험 DB·Excel + 회차 변경분
- 구성
- └ SKILL.md
밖에서 자료를 끌어온다
식약처·공공데이터 API로 임상시험을 수집해 DB와 엑셀로 넣고, 회차 간 변경을 뽑는다.
세 DB에서 논문을 대량 수집한다. DB마다 다른 한도·페이지네이션·응답형식을 다룬다.
논문 한 건의 정보를 통째로 확보하는 통합 진입점.
논문 PDF 를 받는다. 6단계로 물러나며 시도한다.
페이월·Cloudflare 저널용 수집기. 출판사별 규칙 DB 를 스스로 학습한다.
PubMed My Bibliography 에서 논문 목록과 상세를 모은다.
웹페이지를 PDF 로 캡처한다. 봇 감지가 있으면 우회 브라우저를 쓴다.
Chrome 으로 웹페이지를 PDF 로 변환한다.
자유 텍스트를 구조화한다
항암 요법 DB를 만든다. PDF 표를 Vision LLM으로 읽고 식약처 API·약가와 합친다.
페이지를 통째로 넣지 않고 항목 단위로 잘라 확대해 Vision LLM 에 넣는다.
판독문에서 암 병기(TNM·AJCC)를 뽑는다. T·N·M을 정보추출과 분류로 나눠 근거와 함께 낸다.
검사 판독문 결론에서 질병코드를 뽑는다. 규칙으로 힌트를 만들고 LLM이 판단, 실패하면 규칙으로 되돌아간다.
여러 소스를 하나로 합치고 각 필드가 어디서 왔는지 남긴다. 실측이 추정을 덮는다.
저자 역할을 일괄 추출한다. WOS → PubMed → PDF 3단 폴백.
PubMed 메타데이터에서 저자 역할을 뽑는다.
WoS 데이터와 PDF 로 공동 제1저자·교신저자를 뽑는다.
사사에서 연구과제번호와 기관을 뽑는다. NRF·NIH·NSF·IITP 인식.
값을 정하고 근거를 남긴다
제목·대상질환 텍스트를 암 여부와 암종으로 나눈다. 사람이 고친 내용을 다음 분류에 반영한다.
기록 타임라인에서 재발 시점·부위를 판정하고, 정답 대비 정확도를 제대로 측정한다.
MeSH 로 질환 관련도를 등급 판정한다. 확정·추정·주변·무관·미판정.
수천 건을 LLM으로 분류하고 결과를 캐시한다. 어느 모델이 판정했는지 함께 남겨 재현할 수 있다.
논문을 사람 단위로 뒤집어 역할·경력단계·Rising star·기관 집계를 낸다.
결과가 맞는지 대조한다
빠진 DOI 를 회수하고, 컬럼별 완성도와 정확도를 나눠 리포트한다.
'Univ Ulsan, Asan Med Ctr' 같은 표기를 정해진 기관 코드로 판정한다.
같은 사람의 여러 표기를 묶고 동명이인은 나눈다. 한글 로마자 이표기·이니셜 축약 처리.
교신저자를 실제로 확정한다. '마지막 저자' 추정은 실측 39.7% 만 맞는다.
여러 논문 DB 를 합치고 CrossRef 로 교차검증해 계량서지 분석과 보고서를 낸다.
원본과 결과 엑셀을 대조해 건수·중복·누락·범위를 검사하고 리포트를 낸다.
터졌던 버그를 회귀 테스트로 박아 두고, 추론으로 합친 건은 전수 재판정한다.
반출을 받자마자 '써도 되는 것인지' 판정한다. 없으면 무엇을 못 하는지까지 적는다.
위 단계들이 딛고 서는 것
온프렘 Ollama와 클라우드(OpenAI·Azure)를 설정만 바꿔 오가고, 하나가 죽으면 자동으로 넘긴다.
WoS Export 다이얼로그 자동화가 깨졌을 때 원인을 짚는다.