Zotero PDF Inventory - qwen 정리
제공해주신 Zotero PDF storage inventory를 분석한 결과입니다. 현재 라이브러리는 NSCLC (비소세포폐암) 치료, 특히 Durvalumab 관련 연구와 AI/Radiomics 기반의 예측 모델 연구가 주를 이루고 있습니다.
1. 전체 상태 요약
- 총 파일 수: 154개 PDF (Attachment keys: 154)
- 총 용량: 865.2 MB
- 평균 파일 크기: 약 5.6 MB/개 (일부 대형 이미지/데이터 포함 PDF로 인해 평균이 높음)
- 주요 주제:
- NSCLC Immunotherapy: Durvalumab (PACIFIC trial 및 real-world data), Nivolumab, Pembrolizumab, Atezolizumab 등.
- AI & Radiomics: Deep learning을 이용한 CT/X-ray 분석, TILs (Tumor-Infiltrating Lymphocytes) 예측, Survival prediction.
- Clinical Guidelines & Staging: AJCC 8th Edition, NCCN guidelines, ARDS/Interstitial lung disease 관련.
- 특이사항: 모든 attachment key가 단일 PDF를 가리키며, 명시적인 "multiple PDFs"는 없습니다. 하지만 중복된 논문(Duplicate papers)이 여러 개 존재합니다.
---
2. 최근 PDF bundle 목록 정리 우선순위 제안
중복 제거와 메타데이터 정리가 가장 시급한 영역입니다. 아래 그룹별로 처리를 권장합니다.
A. 높은 우선순위: 명확한 중복 (Exact Duplicates)
동일한 논문을 여러 번 다운로드하거나 import하여 발생한 중복입니다. 하나만 유지하고 나머지를 삭제해야 합니다.
- Takeda et al. (Durvalumab Real-World Japan)
XXMPWAFB,KGDEC8N3,7V3ELCS6- *행동:* 세 파일 중 하나만 유지, 나머지 두 개 삭제.
- Park et al. (PACIFIC-KR)
JKAKMGYV,486VGDNF- *행동:* 두 파일 중 하나만 유지, 나머지 삭제.
- Stana et al. (Chemo-Radio-Immunotherapy NSCLC III)
D97ZYIKH,KES7TB62- *행동:* 두 파일 중 하나만 유지, 나머지 삭제.
- Bos and Ware (ARDS causes/pathophysiology)
NJUIPPLZ,5XXFG8QJ- *행동:* 두 파일 중 하나만 유지, 나머지 삭제.
- Adar et al. (Sublobar resection/SBRT/ablation)
8JCQ54BG,4FJPAQ4Z- *행동:* 두 파일 중 하나만 유지, 나머지 삭제.
- Amin et al. (AJCC 8th Edition Staging)
YW6KJIKY,UB3TDSDG- *행동:* 두 파일 중 하나만 유지, 나머지 삭제.
- 1-s2.0-S1556086422018536-main.pdf (Unknown Title)
3FQ5QB6Q,H9EK7HZN- *행동:* 파일 내용이 동일한지 확인 후 하나만 유지. 제목이 없는 경우 DOI를 통해 정확한 메타데이터를 찾아야 함.
B. 중간 우선순위: 유사 주제 또는 불명확한 파일명
- JIIJVXB3 (
PIIS2405630822000726.pdf): 제목이 없는 파일입니다. DOI10.1016/j.jtocrr.2022.100296(예상) 또는 파일 내 텍스트를 확인하여 정확한 논문 정보를 추가해야 합니다. - NJ4AKQDY (
1-s2.0-S0360301621034222-main.pdf): 제목이 없습니다. DOI10.1016/j.ijrobp.2021.08.035(예상)로 검색하여 메타데이터를 보완하세요. - I39FUEC6 (
1-s2.0-S0169500221005201-main.pdf): 제목이 없습니다. DOI10.1016/j.lungcan.2021.04.018(예상)로 확인 필요. - Q8FHTYKG (
1-s2.0-S0169500226006276-main.pdf): 제목이 없습니다. DOI10.1016/j.lungcan.2024.03.015(예상)로 확인 필요. - UJDE5BSY (
jama_zhou_2026_oi...pdf): 파일명이 비표준적입니다.Zhou et al.의 JAMA Network Open 논문을 확인하고, 표준화된 제목으로 재명명하거나 메타데이터를 연결하세요. - 4HW7E4XF (
274e36b9-aa51...pdf): UUID 형태의 파일명입니다. 내용 확인 후 적절한 제목과 저자 정보를 추가해야 합니다.
C. 낮은 우선순위: 고유하지만 용량이 큰 파일
BXPZLDG6(6.6 MB),4HW7E4XF(6.5 MB),FLG4KQMF(6.0 MB),34ULQHFP(6.0 MB) 등.- 이 파일들은 중복이 아니므로 삭제할 필요는 없으나, 저장 공간 최적화를 위해 압축 상태인지 확인하거나, 불필요한 고해상도 이미지가 포함되어 있다면 재인코딩을 고려할 수 있습니다.
---
3. 중복 또는 여러 PDF가 들어 있는 Attachment Key 확인 포인트
현재 목록에서 "Attachment keys with multiple PDFs: 없음"이라고 명시되었으므로, 기술적으로는 하나의 key에 여러 파일이 묶여 있는 경우는 없습니다.
하지만 논리적 중복(Logical Duplicates)이 존재합니다. 즉, 같은 논문을 다른 key로 저장한 경우입니다. 위 '2번 항목'에서 지적한 7그룹의 중복이 이에 해당합니다.
확인 포인트:
- DOI 기반 중복 검색: Zotero 내에서 DOI 필드를 기준으로 중복을 찾아보세요.
PIIS...또는1-s2.0-...형태의 파일명은 종종 DOI가 제대로 인식되지 않아 중복으로 저장되는 원인이 됩니다. - 파일명 유사성:
main.pdf로 끝나는 파일들이 여러 개 있습니다. 이 파일들은 출판사(PubMed Central, Elsevier 등)에서 직접 다운로드한 것으로 보이며, 제목이 누락된 경우가 많습니다. 이들을 우선적으로 메타데이터를 채워야 합니다.
---
4. 사람 vs 자동화 작업 분리
🤖 자동화 (Zotero 플러그인 또는 스크립트 활용)
- 중복 항목 찾기 및 병합:
- Zotero의 "Duplicate Items" 기능을 사용하거나, "Better BibTeX" 또는 "Zotero Duplicate Item Finder" 플러그인을 사용하여 위 A그룹의 중복을 자동으로 감지하고 병합(Merge)하세요.
- 메타데이터 자동 채우기:
- DOI가 있는 파일(
PIIS...,1-s2.0-...)에 대해 Zotero의 "Retrieve Metadata for PDF" 기능을 실행하여 제목, 저자, 저널 정보를 자동으로 가져오세요.
- 파일명 표준화:
- 플러그인(예: "Rename Attachments")을 사용하여 파일명을
Year - Journal - First Author - Title.pdf형식으로 일괄 변경하세요.
👤 사람이 해야 할 일 (수동 검토 및 결정)
- 중복 병합 시 최종 선택:
- 자동화 도구가 중복을 찾았을 때, 어떤 파일을 "주 파일"로 유지할지 결정해야 합니다. (예: 해상도가 더 높은 것, 또는 메타데이터가 더 정확한 것).
- 제목이 없는 파일의 수동 검색:
JIIJVXB3,NJ4AKQDY등 DOI만 있거나 파일명만 있는 경우, PubMed나 Google Scholar에서 DOI를 검색하여 정확한 제목과 저자 정보를 수동으로 입력하거나, PDF 내 텍스트를 복사하여 붙여넣어야 합니다.
- 주제 분류 및 태그링:
- 현재 라이브러리가 NSCLC와 AI/Radiomics에 집중되어 있으므로, 각 항목에
#NSCLC,#Immunotherapy,#Radiomics,#DeepLearning등의 태그를 수동으로 추가하여 향후 검색 효율성을 높여야 합니다.
- 불필요한 파일 삭제 확인:
- 중복 병합 후 남은 "고아(Orphan)" 항목이나, 연구와 무관한 파일(예: 일반적인 머신러닝 논문
ILFVAPCG,SIC9FNX6등)이 실제 연구에 필요한지 재평가하고, 필요 없으면 삭제하세요.
요약 액션 플랜
- Step 1: Zotero에서 "Find Duplicates" 실행 → 위 A그룹 7개 중복 쌍을 병합.
- Step 2: DOI가 있는 무제 파일(
PIIS...,1-s2.0-...)에 대해 메타데이터 검색 실행. - Step 3: 여전히 제목이 없는 파일(
JIIJVXB3등)은 수동으로 DOI를 통해 정보 채우기. - Step 4: 전체 라이브러리에 주제별 태그(
#NSCLC,#AI) 적용.
이 과정을 거치면 154개 중 약 10~15개의 중복/불필요 파일이 정리되고, 메타데이터가 완성된 깔끔한 라이브러리가 될 것입니다.