김성민 포트폴리오
경력기술서 PDF

Backend / AI Engineer · Portfolio 2026

검증 가능한 AI를
서비스 판단으로 연결합니다.

Java/Spring 금융 서비스 백엔드에서 시작해 시계열 ML, LLM, RAG, AI Agent 검증으로 영역을 확장했습니다. 모델의 출력과 서비스의 결정을 분리하고 실패·편향·재현성의 한계를 다음 설계의 근거로 사용합니다.

Backend Systems
데이터 수집·배치·API·운영 연결
AI Decision Layer
모델 출력과 서비스 정책 분리
Verification
독립 실행·백테스트·교차 검토

01 · AI Engineering Research

AI를 어디까지 믿고
어디에서 사람의 판단을 남길 것인가

모델 순위보다 개발 워크플로 안에서 AI와 사람이 맡을 역할의 경계를 실험했습니다.

01

AI Coding Agent Benchmark

Question
업무 성격에 따라 적합한 Coding Agent는 달라지는가?
Tested
동일 Repository와 요구사항에서 Codex와 Claude를 독립 실행하고 교차 평가했습니다.
Learned
단일 순위보다 조사·버그 수정·기능 구현별 역할 배치가 중요했습니다.
Repository
02

AI PR Review Agent

Question
테스트가 통과한 PR도 AI가 의미적으로 검증할 수 있는가?
Tested
고정 PR 5개를 diff·관련 코드·pytest 결과와 함께 검토했습니다.
Learned
Test Pass는 Correctness가 아니며 최종 Merge는 사람의 책임입니다.
Repository
03

Human-AI Review Benchmark

Question
Human과 AI는 어떤 지점에서 다르게 판단하는가?
Tested
8개 고정 Case에서 Human Only와 AI Only의 판단을 비교했습니다.
Learned
AI는 넓은 검증, Human은 맥락과 최종 판단에서 강점을 보였습니다.
Repository

02 · Financial AI

운영 결과에서 검증 절차를
다시 설계한 금융 AI 시스템

기존 Signals 운영에서 확인한 선택 편향과 재현성 문제를 바탕으로 Model Output과 Service Decision을 분리한 V2 정책 구조를 설계했습니다.

Market DataFeatureML ModelsPredictionPolicy / GateSignalValidation
ProblemSelection Bias

Test·Live 결과가 정책 선택에 영향을 준 문제를 확인했습니다.

DecisionClean Validation

Validation-only Selection, Embargo, One-shot Test Evaluation으로 절차를 고정했습니다.

Time SplitForward 2026~

Train 2012~2023, Validation 2024, Test 2025의 시간 순서를 유지합니다.

V2 최신 운영 집계
데이터 연결 중
--
평가 거래
--
승률
--
평균 수익률
--
누적 복리
--
MDD

V2 신호 이력의 최신 종가 평가를 불러오고 있습니다.

거래비용·세금·슬리피지·실제 체결·자본 제약을 반영하지 않은 신호 단위 시뮬레이션입니다. 무료 개인 연구 기록이며 투자 자문, 리딩, 매매 추천을 제공하지 않습니다.

03 · Privacy-aware RAG

검색 품질을 embedding 이전의
데이터 설계부터 다뤘습니다.

더 큰 모델보다 무엇을 제거하고 어떤 의미 단위로 검색할 것인지 먼저 정의했습니다.

ResumePII PolicySemantic ChunkingMetadata + ScopeEmbeddingJSON IndexOllama

PII before embedding

전화번호·주소·개인 보상과 비공개 식별정보를 검색 데이터에서 제거했습니다.

Semantic chunking

고정 글자 수가 아니라 경력·프로젝트·문제 해결 단위로 문서를 분리했습니다.

Scope-aware retrieval

회사 경력과 개인 프로젝트를 구분하고 넓은 질문에는 관련 범위를 다양하게 검색합니다.

Final validation

필수 필드, 중복 ID, 개인정보와 URL 패턴을 인덱싱 전에 다시 검사했습니다.

20
Resume chunks
49
Total chunks
Gemma
Embedding
JSON
Vector index

04 · Engineering View

프로젝트는 달라도
판단 기준은 일관됩니다.

  1. 01Model Output ≠ Service Decision

    모델 예측은 정책·위험·시장 조건을 거쳐 서비스 결정이 됩니다.

  2. 02Test Pass ≠ Correctness

    통과한 테스트가 요구사항·계약·회귀를 모두 보장하지는 않습니다.

  3. 03AI Output ≠ Final Judgment

    AI는 근거를 확장하고 프로젝트 맥락과 최종 책임은 사람이 가집니다.

  4. 04Performance ≠ Reproducibility

    높은 수치보다 선택 편향·검증 절차·전진 재현성을 함께 확인합니다.

  5. 05Retrieval Starts Before Embedding

    RAG 검색 품질은 개인정보 정책과 청크 설계에서 시작합니다.