🧬 연구 허브

Skill

wos-export-check 코드 참조

반출을 받자마자 '써도 되는 것인지' 판정한다. 없으면 무엇을 못 하는지까지 적는다.

왜 필요한가

AML 프로젝트 반출은 Full Record 로 받았는데도 OI(ORCID)·C3(정규화 기관명)·DE(저자키워드)가 0% 였다. 파일을 받자마자 이걸 잡아내는 게 목적이다.

Full Record 를 골랐다고 해서 모든 필드가 채워져 오지 않는다. 몇 주 분석한 뒤에 "ORCID 가 없어서 동명이인을 못 나눈다"를 발견하면 반출부터 다시 해야 한다. 반출은 기관 라이선스·검색 세션에 묶여 있어 나중에 다시 받기 어려울 수도 있다.

정본 코드

~/Documents/혜연/BTC_KOL_PoC/check_wos.py   142줄
python3 check_wos.py     # raw/wos/ 아래를 재귀 탐색

_archive_* 디렉터리는 건너뛴다.

두 가지 컬럼명 체계를 모두 받는다

구형/탭구분 : 2글자 태그        (PM, DI, RP …)
현행 Excel  : 전체 이름         (Pubmed Id, DOI, Reprint Addresses …)

같은 WoS 인데 반출 경로에 따라 컬럼명이 다르다. 둘 다 받아들이지 않으면 파일 하나를 못 읽는다.

필드표에 "없으면 무엇을 못 하는지"를 적는다

이게 이 스킬의 핵심이다. 단순히 "필수/선택" 이 아니라 결측의 결과를 적어 둔다.

태그필드없을 때필수
PMPubMed IDPubMed 와 병합 불가✓
DIDOIPMID 없는 논문 병합 불가✓
AF저자 전체명동명이인 분리 불가✓
C1저자별 소속주소2015년 이전 소속 결측 해결 불가✓
RP교신저자(Reprint)교신저자 실측 불가 (추정 44% 오차 유지)✓
OIORCIDORCID 기반 동명이인 분리 불가
C3정규화 기관명기관명 정규화를 직접 해야 함
DE저자 키워드연구주제 보강 불가
TC피인용수영향력 지표 없음
EM이메일연구자 식별 키 하나 상실

"RP 가 없으면 교신저자 추정 44% 오차를 그대로 안고 간다" 처럼 결과를 적어 두면, 반출을 다시 받을지 그냥 갈지를 그 자리에서 판단할 수 있다. 필수 여부만 적힌 표로는 그 판단이 안 된다.

언제 돌리나

파일을 받은 직후, 다른 어떤 처리보다 먼저. 이 검수를 통과해야 파이프라인에 넣는다.

WoS 반출 → check_wos.py → (통과) → 병합 → 정규화 → 분석
                        ↘ (실패) → 반출 다시

다른 소스에도 같은 걸 하라

WoS 전용 스크립트지만 발상은 모든 원본 데이터에 쓴다. 원본을 받으면 "이 파일로 하려던 걸 할 수 있는가"를 먼저 판정하고, 못 하면 무엇을 못 하는지 적는다. 병원 데이터 반출, 공공데이터 API 응답, 엑셀 수령분 모두 마찬가지다.

연관 skill

pipeline-validate(이후 단계 검증), paper-merge-provenance, author-disambiguate(AF·OI 가 있어야 가능), corresponding-author-verify(RP 가 있어야 가능)