🧬 연구 허브

Skill

다시 쓸 수 있게
뽑아둔 것들

연구가 흘러가는 순서대로 묶었습니다. 카드마다 무엇을 넣으면 무엇이 나오는지, 그리고 어떤 파일이 들어 있는지가 적혀 있어 서로 견줘 보기 쉽습니다. 32개 중 8개는 바로 실행되는 코드를 담고 있습니다.

수집

밖에서 자료를 끌어온다

식약처·공공데이터 API로 임상시험을 수집해 DB와 엑셀로 넣고, 회차 간 변경을 뽑는다.

입력
식약처·공공데이터 API
출력
임상시험 DB·Excel + 회차 변경분
구성
└ SKILL.md

세 DB에서 논문을 대량 수집한다. DB마다 다른 한도·페이지네이션·응답형식을 다룬다.

입력
검색식
출력
PubMed·OpenAlex·KoreaMed 논문 목록
구성
└ SKILL.md

논문 한 건의 정보를 통째로 확보하는 통합 진입점.

입력
DOI 또는 PMID
출력
메타데이터 · PDF · 저자 · 사사
구성
└ SKILL.md

논문 PDF 를 받는다. 6단계로 물러나며 시도한다.

입력
DOI 또는 PMID
출력
PDF 파일
구성
└ SKILL.md

페이월·Cloudflare 저널용 수집기. 출판사별 규칙 DB 를 스스로 학습한다.

입력
페이월 저널 URL
출력
PDF + 출판사 규칙 학습
구성
└ SKILL.md

PubMed My Bibliography 에서 논문 목록과 상세를 모은다.

입력
My Bibliography 주소
출력
논문 목록 + 상세정보
구성
└ SKILL.md

웹페이지를 PDF 로 캡처한다. 봇 감지가 있으면 우회 브라우저를 쓴다.

입력
웹페이지 URL
출력
PDF 파일
구성
└ SKILL.md

Chrome 으로 웹페이지를 PDF 로 변환한다.

입력
웹페이지 URL
출력
PDF 파일
구성
└ SKILL.md

추출

자유 텍스트를 구조화한다

regimen-extract1개 실행 가능

항암 요법 DB를 만든다. PDF 표를 Vision LLM으로 읽고 식약처 API·약가와 합친다.

입력
공고책자 PDF + 식약처 API
출력
항암 요법 DB (SQLite·D1)
구성
├ SKILL.md
└ scripts/corrections.py

페이지를 통째로 넣지 않고 항목 단위로 잘라 확대해 Vision LLM 에 넣는다.

입력
표·카드가 빽빽한 PDF
출력
구조화 JSON
구성
└ SKILL.md
tnm-staging-extract1개 실행 가능

판독문에서 암 병기(TNM·AJCC)를 뽑는다. T·N·M을 정보추출과 분류로 나눠 근거와 함께 낸다.

입력
병리·영상 판독문
출력
TNM 병기 + 근거 문장
구성
├ SKILL.md
└ scripts/evidence.py

검사 판독문 결론에서 질병코드를 뽑는다. 규칙으로 힌트를 만들고 LLM이 판단, 실패하면 규칙으로 되돌아간다.

입력
검사 결론문
출력
질병코드 + 판정 근거
구성
└ SKILL.md

여러 소스를 하나로 합치고 각 필드가 어디서 왔는지 남긴다. 실측이 추정을 덮는다.

입력
소스별 수집 결과
출력
통합 코퍼스 + 필드별 출처
구성
└ SKILL.md

저자 역할을 일괄 추출한다. WOS → PubMed → PDF 3단 폴백.

입력
논문 목록
출력
제1·교신·공동1저자 표
구성
└ SKILL.md

PubMed 메타데이터에서 저자 역할을 뽑는다.

입력
PMID
출력
제1저자 · 책임저자
구성
└ SKILL.md

WoS 데이터와 PDF 로 공동 제1저자·교신저자를 뽑는다.

입력
논문 PDF + WoS 데이터
출력
공동1저자 · 교신저자
구성
└ SKILL.md

사사에서 연구과제번호와 기관을 뽑는다. NRF·NIH·NSF·IITP 인식.

입력
사사(Acknowledgement) 문구
출력
과제번호 + 지원기관
구성
└ SKILL.md

판정·분류

값을 정하고 근거를 남긴다

cancer-type-classify1개 실행 가능

제목·대상질환 텍스트를 암 여부와 암종으로 나눈다. 사람이 고친 내용을 다음 분류에 반영한다.

입력
제목 · 대상질환 · 연구목적
출력
암종 판정 [값 · 확신도 · 근거]
구성
├ SKILL.md
└ scripts/feedback_guard.py
recurrence-detect1개 실행 가능

기록 타임라인에서 재발 시점·부위를 판정하고, 정답 대비 정확도를 제대로 측정한다.

입력
환자 기록 타임라인 + 정답
출력
재발 판정 + 정확도 리포트
구성
├ SKILL.md
└ scripts/score.py

MeSH 로 질환 관련도를 등급 판정한다. 확정·추정·주변·무관·미판정.

입력
넓게 수집한 논문 코퍼스
출력
5등급 관련도 (지우지 않음)
구성
└ SKILL.md
lit-relevance-classify1개 실행 가능

수천 건을 LLM으로 분류하고 결과를 캐시한다. 어느 모델이 판정했는지 함께 남겨 재현할 수 있다.

입력
논문 레코드 수천 건
출력
판정 캐시 (모델·시각 기록)
구성
├ SKILL.md
└ scripts/classify_cache.py

논문을 사람 단위로 뒤집어 역할·경력단계·Rising star·기관 집계를 낸다.

입력
병합된 논문 코퍼스
출력
연구자 프로파일 Excel (5시트)
구성
└ SKILL.md

검증·분석

결과가 맞는지 대조한다

빠진 DOI 를 회수하고, 컬럼별 완성도와 정확도를 나눠 리포트한다.

입력
병합된 서지 데이터
출력
DOI 보정 + 품질 리포트
구성
└ SKILL.md

'Univ Ulsan, Asan Med Ctr' 같은 표기를 정해진 기관 코드로 판정한다.

입력
자유 표기된 소속 문자열
출력
기관 코드 + 한/영 라벨
구성
└ SKILL.md

같은 사람의 여러 표기를 묶고 동명이인은 나눈다. 한글 로마자 이표기·이니셜 축약 처리.

입력
저자명 표기 목록
출력
동일인 묶음 + 애매한 건 목록
구성
└ SKILL.md

교신저자를 실제로 확정한다. '마지막 저자' 추정은 실측 39.7% 만 맞는다.

입력
논문 메타데이터 + PMC/PDF
출력
확정된 교신저자 + 판정 근거
구성
└ SKILL.md
biblio-analysis1개 실행 가능

여러 논문 DB 를 합치고 CrossRef 로 교차검증해 계량서지 분석과 보고서를 낸다.

입력
WoS · PubMed · KoreaMed 파일
출력
통합 서지 + 교차검증 + 분석
구성
├ SKILL.md
└ scripts/crossref_verify.py
excel-case-validator2개 실행 가능

원본과 결과 엑셀을 대조해 건수·중복·누락·범위를 검사하고 리포트를 낸다.

입력
원본 Excel + 결과 Excel
출력
건수·중복·누락 검증 리포트
구성
├ SKILL.md
├ scripts/dedup.py
└ scripts/validate.py

터졌던 버그를 회귀 테스트로 박아 두고, 추론으로 합친 건은 전수 재판정한다.

입력
파이프라인 산출물 전체
출력
항목별 PASS/FAIL + 회귀 검사
구성
└ SKILL.md

반출을 받자마자 '써도 되는 것인지' 판정한다. 없으면 무엇을 못 하는지까지 적는다.

입력
WoS 반출 파일
출력
필드별 결측 판정 + 영향
구성
└ SKILL.md

기반·도구

위 단계들이 딛고 서는 것

llm-provider-switch1개 실행 가능

온프렘 Ollama와 클라우드(OpenAI·Azure)를 설정만 바꿔 오가고, 하나가 죽으면 자동으로 넘긴다.

입력
LLM 요청
출력
응답 + 어느 provider 가 답했는지
구성
├ SKILL.md
└ scripts/thinking_json.py

WoS Export 다이얼로그 자동화가 깨졌을 때 원인을 짚는다.

입력
실패한 Selenium 스크립트
출력
고쳐진 selector 패턴
구성
└ SKILL.md