🧬 연구 허브

프로젝트

무엇이 어디에 있는가

행을 누르면 설명·경로·연결된 Skill 이 펼쳐집니다. 정본은 살아있는 원본이라 이것만 고치면 되고, 복사본은 참고만, 확인 필요는 아직 어느 쪽이 원본인지 안 정해진 것입니다.

임상시험 · 치료옵션

ctrial-auto_4월 정본 2026-07-29 · 57 py · 316 MB 식약처 임상시험 수집 → 암종 분류 → 회차 간 변경 비교까지 도는 파이프라인

공공데이터포털 목록·상세 API로 승인 임상시험을 긁고, 제목과 대상질환으로 암 여부·암종을 분류한 뒤, 지난 회차 대비 신규·상태변경·종료를 뽑아 Excel로 냅니다. 암종 분류에는 사람이 고친 내용을 다음 판정에 반영하는 피드백 구조가 들어 있습니다.

~/Documents/혜연/ctrial-auto_4월

허초프로젝트 정본 2026-08-11 · 37 py · 658 MB 항암제 DB — 허가초과 요법·급여기준·약가를 7개 소스에서 모아 구축

HIRA 공고책자와 Onco Regimen book PDF를 Vision LLM으로 읽고, 식약처 허가·대조약 API와 약가 엑셀을 합칩니다. 사람이 고친 내용을 별도 JSON에 두고 다시 적용하는 방식이라 재추출해도 교정이 살아남습니다. Cloudflare Pages + D1 로 서비스됩니다.

~/Documents/혜연/허초프로젝트

판독문 · 병기

CRC-TNM-Agents 정본 2026-03-12 · 222 py · 2.4 GB 대장암 TNM 병기 추출 — 에이전트 30여 개로 쪼갠 판독문 해석

병리·영상 판독문에서 병기를 뽑습니다. T·N·M을 각각 정보추출과 분류로 나눠 사실 수집과 규칙 적용을 분리했고, 모든 필드가 근거 문장과 확신도를 함께 냅니다. 판정이 불가능하면 억지로 값을 내지 않고 '보류'로 표시합니다. 온프렘 Ollama와 클라우드를 갈아끼우는 LLM 연결 계층도 여기서 나왔습니다.

~/Documents/혜연/CRC-TNM-Agents

LungCancerRecurrence 정본 2026-08-06 · 90 py · 2.3 GB 폐암 재발 판정 + LLM 정확도를 제대로 재는 방법

환자별 기록 타임라인에서 재발 여부·재발일·부위를 판정합니다. 재발보다 값진 건 평가 설계입니다 — 날짜 ±30일 허용, 부위 Jaccard 부분점수, 홀드아웃 40명, 같은 입력 3회 다수결. 모델 비교 결과와 제외 사유까지 문서로 남아 있어 어떤 추출 과제에도 그대로 씁니다.

~/Documents/혜연/LungCancerRecurrence

건강의학과 정본 2026-07-22 · 36 py · 108 MB 검사 판독문 → 질병코드. 규칙과 LLM을 섞은 하이브리드

경동맥·관상동맥·PWV/ABI 판독문의 결론에서 코드를 뽑습니다. 규칙으로 뽑은 소견을 힌트로 넣어 LLM이 판단하고, LLM이 JSON을 3번 실패하면 규칙 결과로 되돌아갑니다. 부정문(‘no significant stenosis’) 처리가 정확도의 핵심입니다. 경동맥 120·170건, 관상동맥 140건 등 검증 케이스 엑셀이 함께 있습니다.

~/Documents/혜연/건강의학과

논문 · 서지

BTC_KOL_PoC 확인 필요 2026-08-11 · 32 py · 1.6 GB 담도암 분야 핵심 연구자(KOL) 발굴 — 논문 수집부터 판정까지 전 과정

PubMed·OpenAlex·KoreaMed·WoS를 긁어 하나로 합치고, DOI·기관명을 정리한 뒤, 논문 관련성과 저자 전문분야를 LLM으로 판정합니다. 이 7개 중 가장 많은 기술이 나온 프로젝트입니다 — 공식 API가 없는 KoreaMed를 폼 재전송으로 긁는 법, 실측이 추정을 덮는 병합 규칙, 저널 축약어를 못 다루면 DOI 회수율이 6배 틀리는 문제, 완성도와 정확도를 섞지 않는 품질 리포트가 전부 여기서 나왔습니다. 다만 이 7개 중 유일하게 IMOK/ 쪽 사본이 더 최신이라(5시간 차) 작업 전에 어느 쪽에서 이어갈지 확인이 필요합니다.

~/Documents/혜연/BTC_KOL_PoC

paper-collection-toolkit-v2 정본 2026-08-13 · 160 py · 8 MB 논문 PDF·저자·사사 수집 툴킷 — 이 목록에서 유일하게 테스트가 있는 프로젝트

DOI/PMID 로 메타데이터를 풀고 PDF 를 확보해 저자·사사까지 뽑습니다. 페이월과 Cloudflare 를 뚫는 출판사별 규칙 DB, 6단계 폴백 다운로더, PubMed·WoS 저자 추출기가 모듈로 분리돼 있고 테스트 11개가 붙어 있습니다. skills/ 폴더가 ~/.claude/skills 와 동기화되는 스킬 저장소를 겸합니다. 경로가 IMOK/ 아래라 다른 7개(혜연/)와 위치가 다릅니다.

~/Documents/IMOK/paper-collection-toolkit-v2

그 외

하나생명 정본 2026-07-23 · 509 py · 3.8 GB 보험 상품 문서를 지식화해 자문에 쓰는 프로젝트

그래프·표가 많아 텍스트 추출이 안 되는 PDF를 페이지 이미지로 정독해 지식 DB에 넣습니다. 아직 이 코드에서 뽑아낸 Skill 은 없습니다.

~/Documents/혜연/하나생명

알아둘 중복

같은 코드가 여러 벌 있습니다. 엉뚱한 복사본을 고치면 반영이 안 되니 작업 전에 확인하세요.

무엇정본복사본
임상시험 수집IMOK/ctrial-auto
2026-07-30, 46 py
5벌 — _api, _4월, _2월, CTrial_AUTO, ctrial_auto_module
TNM 병기 추출확인 필요
기능 전체는 CRC-TNM-Agents(2026-03-12), LLM 계층만 _crc(2026-07-14)가 최신
7벌 — _1, -251217, crc-tnm-app, crc-tnm-registry-*, @GMP/*
질병코드 추출medical_code_extractor 2건강의학과/medical_code_extractor