강신성 Shinsung Kang

LLM 파인튜닝·선호도 최적화(RLHF/RLAIF), 시계열 자료분석, 통계분석 및 시각화 수행 가능

About

전북대학교 통계학 학사 졸업 예정(2027.02). 학부 과정 중 LLM 사후학습 및 생성 텍스트 판별, 시계열 전이학습 관련 연구에 참여하여 실험 및 논문 작성을 수행해왔습니다. 실험에 필요한 Ubuntu 기반 Docker 컨테이너 구축, 패키지 종속성 관리에 능숙합니다. R을 이용한 고전적인 데이터 분석부터, PyTorch·vLLM 기반의 모델 학습·서빙까지 폭넓게 처리할 수 있습니다.

Featured Projects

MIMIC-IV 임상 텍스트 LLM 정렬 파이프라인 SurvLLM 연구 진행중

퇴원요약지에서 생존분석용 임상 변수를 추출하는 Llama-3.1-8B 사후 학습 파이프라인 단독 구축

문제
생존분석의 핵심 입력(활력징후, 입원 검사 수치)이 최대 16,384 토큰의 비정형 퇴원요약지에 묻혀 있는 상황에서 할루시네이션 없이 약속된 포맷으로 임상 변수를 추출하는 신뢰 가능한 자동화 프로세스가 필요
접근
MIMIC-IV(Hosp/Patients·Admissions, Note/Discharge) 기반으로 Llama-3.1-8B-Instruct를 QLoRA(4-bit)로 SFT한 뒤, 후보 응답 5개 생성 → 선호도 레이블링 → DPO와 RM+PPO 두 가지 Alignment 경로를 모두 구현. 인간 레이블(200건 중 130건 직접 레이블링)과 Qwen3-30B-A3B 기반 레이블을 동일 조건에서 통제 비교
엔지니어링
H200 단일 GPU 환경에서 긴 컨텍스트를 가지는 데이터셋으로 사후 학습을 수행하기 위해 4-bit QLoRA 세팅을 적용. 4-bit 모델에 LoRA를 병합하면 SFT 가중치가 왜곡되는 문제를 규명하고, DPO 프로세스에서 어댑터 병합 없이 policy/reference 어댑터를 이중 로드하는 방식으로 해결. FSDP-QLoRA 멀티 GPU 학습, RLAIF 레이블링 전용 시스템/유저 프롬프트 구조, 생성 텍스트 평가를 위한 6단계 규칙과 JSON 순위 검증·재시도 로직을 설계
역할 · 현황
Two-Track(LLM 추출 + SurvLIFT 생존모형) 연구 중 LLM 트랙 전체를 담당. (시스템 프롬프트·SFT 레이블 포맷은 참여 연구원이 지원) 추출 결과를 15개 임상 공변량으로 파싱하여 생존모형 트랙에 전달. 현재 성능 평가(c-index) 단계 진행 중

PyTorchTransformersTRLPEFT · QLoRAvLLMDPO · PPOFSDPDockerwandb

인간/LLM 생성 텍스트 판별 연구 LLMdetector KJAS 게재 · 공동 1저자

해석 가능한 통계 피처로 인간 vs LLM 텍스트를 판별 — 이진 정확도 97.8%, 생성 모델 식별 86.0%

문제
LLM 생성 텍스트를 블랙박스 분류기가 아닌 해석 가능한 통계적 근거로 판별하고, 나아가 GPT·Gemini·Claude·DeepSeek 중 어느 모델이 생성했는지까지 식별하는 문제
접근
Quora 질문(데이터 오염 방지를 위해 3년 이전 게시글 한정)에 대한 인간·4개 LLM 답변 14,833건의 코퍼스를 사용해, 문체 통계(어휘 밀도·가독성 지수 등) + Llama-3.1-8B perplexity + 계층적 LDA 토픽 분포 피처를 결합하고 PyTorch DNN으로 분류. Ablation 3종으로 피처별 기여도를 정량화
성과
이진(human vs LLM) 정확도 97.8%, 5-way 생성 주체 식별 86.0% — 원시 토큰 임베딩 베이스라인(55.6%) 대비 30%p 이상 향상. 인간 텍스트의 perplexity가 LLM 대비 약 2배 높음을 정량 확인
역할
Perplexity 계산·피처 주입 구현, 시각화, LDA·DNN·평가 지표 코드 오류 검토와 버전 관리, 해당 파트 논문 집필 및 관련 연구 조사 수행

PyTorchTransformersgensimNLTKtextstatscikit-learn

시계열 전이학습 베이스라인 실험 인프라 TSTF IEEE Access 논문 기여

레거시 Keras 실험을 PyTorch로 단독 재구현하고, 데이터셋당 500개 모델 앙상블 실험을 멀티 GPU로 자동화

문제
N-BEATS 전이학습 논문(IEEE Access)의 비교 실험에 필요한 PatchTST 베이스라인이 레거시 Keras 코드로는 재현·확장이 어려운 상황. 타겟 데이터셋 7종 × 손실함수 5종 × 모델 100개의 실험 매트릭스를 감당할 인프라가 필요
접근
HuggingFace PatchTST 백본을 M4 데이터로 부트스트랩 사전학습한 뒤 head를 교체(Transformer/LSTM/MLP)해 파인튜닝하는 전이학습 파이프라인을 PyTorch로 구축하고, median·지수 가중 앙상블로 최종 예측을 산출. 21개 실험 태스크를 multiprocessing 큐와 GPU 라운드로빈으로 자동화 — 결과 존재 시 스킵하는 재시작 안전 설계로 L40S 2-GPU 활용률 98%를 달성
품질 기여
원본 실험 코드의 결함(MASE 손실 오구현, MAPE의 0값 발산, 데이터 분할 분포 불일치)을 발견·문서화하고 방어 로직을 반영. 베이스라인 실험 결과는 논문 최종본에 수록
역할
torch/ 디렉토리 100% 단독 구현 및 결과 집계·보고 (논문 Acknowledgement 기재)

PyTorchTransformers · PatchTSTmultiprocessingpandas

NYC 택시 트래픽 대시보드 NYCTaxiDash 라이브 데모

택시 트래픽을 요일·시간·지역으로 탐색하는 인터랙티브 대시보드 — 클로드 코드 기반 기존 프로젝트 개선

개요
NYC 택시 운행 로그를 통해 교통 상황을 간접적으로 파악하기 위한 대시보드. 데이터시각화 강의 과제로 제작한 정적 히트맵·경로도를, 바이브 코딩을 통하여 실무 수준의 인터랙티브 제품으로 재구축
접근
순수 정적 스택(MapLibre GL + Plotly.js + 바닐라 JS)으로 서버 없이 GitHub Pages 배포. 정제된 트립 14,446건을 브라우저에 싣고 요일·시간 필터를 클라이언트에서 실시간 재집계. 도로망 통행 플로우는 osmnx 최단경로를 빌드 전 집계
핵심 기능
두 레이어 — ① 도로 플로우(두께=통행량, 색=세그먼트 평균 속도로 정체 인코딩) ② 헥스빈 히트맵 (요일 멀티선택 × 시간대). 선택에 연동되는 KPI·히스토그램, 최단경로 거리 기반 속력 계산
역할
Claude Code와의 반복적인 페어 프로그래밍으로 데이터 파이프라인부터 프론트 시각화까지 구현. 표본 부족 셀 반투명 처리, 속력의 하한 추정 성격 명시 등 시각적 대비 요인 및 통계적 정직성 부여

Claude CodePlotly.jspandasJavaScriptGitHub Pages

Publications & Contributions

  1. Hyungbin Park, Shinsung Kang, Kihoon Lee, Gwangsu Kim. (2026). Study on comparative and discriminatory methodology of human and machine-generated languages. Korean Journal of Applied Statistics, 39(3), 235–255. † 공동 1저자 DOI
  2. Minwoo Lee, Youngmi Lee, Gwangsu Kim. (2026). Transfer Learning Based on N-BEATS in Forecasting Univariate Time Series. IEEE Access, 14, 45191–45212. 베이스라인 실험 기여 (Acknowledgement) Link

Skills

언어
Python, R, Julia, SAS, C#
ML · DL
PyTorch, HuggingFace(Transformers·PEFT·TRL), vLLM, scikit-learn
데이터 · 시각화
SQL(ANSI·Oracle), pandas, numpy, Plotly, matplotlib, seaborn
인프라 · 도구
Linux, Docker, git/GitHub, Claude Code, wandb, FSDP

Education & Certificates