🧬 연구 허브

Skill

author-extractor-wos 코드 참조

WoS 데이터와 PDF 로 공동 제1저자·교신저자를 뽑는다.

PDF 논문에서 공동 1저자, 교신저자 정보를 GPT-4o Vision으로 추출합니다. WOS(Web of Science) 데이터를 활용하여 정확도를 높입니다.

사용법

import os, sys
SKILLS_HOME = os.environ.get('SKILLS_HOME', os.path.expanduser('~/projects/skills'))
sys.path.insert(0, SKILLS_HOME)

from paper_author_extractor_wos import AuthorExtractor, ExtractorConfig

# 추출기 초기화
extractor = AuthorExtractor()

# PDF에서 저자 정보 추출 (기본)
result = extractor.extract_from_pdf('$ARGUMENTS')

# WOS 데이터와 함께 사용 (권장 - 더 정확함)
wos_data = {
    'wos_author_full_names': 'Lee, Jeong-Moo; Han, In Woong; ...',
    'wos_addresses': '[Lee, Jeong-Moo] Univ Seoul, Dept Medicine; ...',
    'wos_reprint_addresses': 'Lee, DW (corresponding author), Inha Univ, ...'
}
result = extractor.extract_from_pdf('paper.pdf', wos_data=wos_data)

# 결과 확인
print(f"1저자: {result.get('first_author')}")
print(f"교신저자: {result.get('corresponding_author')}")
print(f"1저자 소속: {result.get('first_author_affiliations')}")

핵심 기능

  • WOS 데이터로 저자 이름/순서, 교신저자, 소속 정보 확정
  • PDF 이미지 분석으로 공동 1저자 식별 (WOS에 없는 정보!)
  • GPT-4o Vision 기반 분석

환경 변수

  • OPENAI_API_KEY: OpenAI API 키 (필수)

의존성 설치

pip install -r ~/projects/skills/paper_author_extractor_wos/requirements.txt