제품·규정 지식, Tool·API·기능, 사용자·정책 분포의 변화를 운영 로그와 신규 source에서 수집한다.
변경 데이터 후보 생성Research Proposal
LLM을 위한 데이터 가치 평가·생성 과제
Data-centric continual learning / Data-centric anti-forgetting
Future Operation Scenario
언제 continual learning을
실행할 것인가
장기 서빙 중 아래 변화가 품질 기준을 넘을 때만 update 후보를 연다.
제한 용량 serving tier · Muse Glimmer-30B / Gemma 4-26B-A4B / Qwen3.8-27B ↔ 성능 상한 · Kimi K3 2.8T·104B-active · 질문: 1년+ 누적 update에서 capacity–forgetting trade-off는 언제 시작되는가? (Marek et al., 2026)
Freshness, task success, risk KPI를 변경 전 기준선과 비교해 영향 범위와 심각도를 측정한다.
Held-out 평가에서 기준 미달RAG·prompt·rule 수정과 학습 update의 효과·비용·forgetting을 같은 조건에서 비교한다.
이때 continual learning 실행실행 조건 = 변화 감지 ∧ KPI 임계치 초과 ∧ RAG·prompt·rule로 미해결 ∧ 예상 개선 > forgetting·update 비용
From Change Request to Data Action
제품 변경 요청을
데이터 조치로 번역한다
사례명은 달라도 과제의 입력은 같다. 무엇을 넣고, 무엇을 지키고, 무엇을 빼야 하는가?
Tool/API v2, 제품 사양
구버전과 신버전을 함께 측정해 add·replace 후보를 선정
비관련 기능과 fallback 행동까지 회귀 평가
정책·국가·언어 비대칭
거절·누락·어조 차이를 만드는 샘플을 찾아 균형 생성
반대 관점과 중립 요청의 성능을 동시에 보호
개인정보·저작권·위험 절차
직접 질문과 paraphrase·추출 공격을 삭제 범위로 구성
관련 정상 지식의 과잉 삭제를 별도 측정
자주 바뀌는 long-tail 사실
저효용·고변동 지식은 가중치 밖으로 외부화
고정 크기에서 실제 capacity reuse를 입증
따라서 공통 평가 단위는 사례명이 아니라 Add–Retain–Forget decision episode다
Proposal Scope
1년차 과제 범위
연구 축은 넓게 보되, 제품에서 검증 가능한 핵심부터 순차적으로 확장한다.
모델 알고리즘은 고정 actuator로 사용하고, 연구 변수는 데이터 선택·생성·구성으로 제한한다
ARF-Bench
Add–Retain–Forget을
한 episode에서 평가한다
- 새 tool·절차·언어·추론
- Student가 아직 모르는 지식
- Hidden paraphrase·execution
- 핵심 제품 기능·안전 규칙
- Target과 가까운 near-neighbor
- 일반 능력 far-retain
- 구버전·오류 지식 교체
- 개인정보·저작권 실제 제거
- 비대칭 행동 재균형
차별점: 무엇을 학습할지뿐 아니라 무엇을 남기고 뺄지까지 고정 예산 안에서 결정
Use Case A · Product Knowledge Replacement
“새 명령어”가 아니라
새 tool 행동을 학습한다
Firmware v1
spot_clean(area)
return_to_dock()
Firmware v2
area_lookup()
exclusion_check()
spot_mop(passes=2)
dock_wash_mop()
필요한 데이터
ADD 새 schema·argument·multi-step trajectory
REPLACE 위험한 v1 호출 → v2 contrast
RETAIN 공통 안전·구형 제품 version routing
EXTERNALIZE firmware 지원표·최신 error code
검증: 문장 유사도가 아니라 simulator의 실제 실행 성공과 안전 위반으로 판정
첫 실증으로 적합: version ground truth와 executor가 있어 데이터 품질을 모델 밖에서 검증 가능
Use Case B · Targeted Knowledge Removal
지울 데이터보다 먼저
보존할 이웃을 정의한다
TARGET
대상 예시
개인정보 · 특정 저작물 · 명시적 위험 절차 · 폐기된 내부 문서
history - target clean retraining과 비교답을 거절한다고 삭제된 것이 아니다. 제거성과 near/far retain을 같은 checkpoint에서 평가한다
Use Case C · Bias As a Stress-Test
편향은 지식 삭제가 아니라
대칭 행동 교정 문제다
잘못된 접근
- 중국 관련 사실 자체가 손상될 수 있음
- 선택적 거절·침묵을 중립성으로 오인
- 반대 방향의 지정학적 편향 가능
- 미국 관련 대칭 control 부재
제안 접근
- 미·중 comparable issue를 동일 taxonomy로 구성
- 공식·국제·학술·독립 source와 시점 기록
- 거절·누락·어조·근거·인용 왜곡 비교
- 영어·중국어·한국어 held-out 평가
균형은 50:50이 아니라 같은 평가 규칙, source provenance, coverage와 근거 기반 불확실성
Meta Data Engine
데이터를 생성하기 전에
행동을 결정한다
Inventory
현재 모델·지식·제품 KPI·예산
Quality Gate
정답·출처·privacy·license·중복
Valuation
신규성·효용·학습성·충돌
Action
Add·retain·replace·externalize
Generation
Contrast·near-retain·on-policy
Evidence
실제 gain을 다음 episode에 축적
Meta-learning 대상은 모델 적응 자체보다 “어떤 데이터 결정이 실제 제품 개선을 만들었는가”
Conditional Data Value
좋은 데이터는 고정 속성이 아니라
현재 모델과 예산의 함수다
Cheap score로 후보를 줄이고, 작은 pilot update의 실제 marginal gain으로 valuator를 보정
Knowledge Turnover Package
산출물은 checkpoint가 아니라
재현 가능한 데이터 package다
Episode Input
Current model state
Candidate new data
Knowledge inventory
Product KPI & constraints
Source / executor / rule
add-internalize.jsonl새로 내재화할 지식·행동retain-near.jsonlTarget 인접 보호 지식retain-far.jsonl핵심 일반 능력·안전replace-contrast.jsonl구지식→신지식 교체on-policy-corrections.jsonlStudent 오류 기반 교정externalize-manifest.jsonRAG·local memory 이동forget-target.jsonl실제 제거 대상과 범위decision-report.mdAction·근거·confidence·lineageSource → knowledge → sample → batch → model → eval 계보를 100% 추적
Proof of Capacity Reuse
“지웠다”가 아니라
새 지식 수용량이 늘었음을 증명
성공 조건
E가 C·D보다 신규 획득을 높이고 핵심 retain constraint를 만족해야 한다.
결과 방향이 clean retraining F와 일치해야 targeted turnover의 근거가 된다.
고정: parameter, adapter byte, token, step, FLOPs, update operator
포화는 parameter 수로 선언하지 않고 acquisition–retention Pareto frontier로 확인
Why Samsung
삼성은 실제 continual data stream과
on-device 제약을 동시에 가진다
제품군과 버전
Galaxy·TV·가전·SmartThings의 기기·지역·언어·firmware가 지속적으로 변화
Device 제약
Privacy·offline·latency·RAM·energy 때문에 모든 지식을 cloud에 맡길 수 없음
검증 가능한 행동
Tool registry와 simulator로 새 기능·안전·version routing을 자동 평가 가능
Portfolio leverage
제품별 update 결과를 공통 meta signal로 축적하되 원시 데이터를 섞지 않음
Deployment Boundary
Cloud는 만들고 검증하고,
device는 최소 지식만 실행한다
Cloud · Central Data Plane
- Source 정규화와 knowledge inventory
- Data valuation·generation·human review
- Student rollout과 teacher correction
- 고정 recipe update·ARF release gate
- Signed model/data package 배포
On-device · Private Execution Plane
- 빈번하고 안정적인 offline 행동 내재화
- 변동 사실은 local DB/RAG로 분리
- 사용자 선호는 격리된 local memory
- 원시 로그 대신 privacy-safe 실패 signal
- 권한·지원 API·안전 조건 재검증
매 prompt에 학습하지 않는다. 검증된 주간·월간·제품 release batch에서만 update
12-Month Plan
벤치마크에서 시작해
on-device 실증으로 끝낸다
WP0
정의·Governance
Schema, action taxonomy, KPI, source·license rule
WP1
ARF-Bench α
Factual capacity, tool stream, clean reference
WP2
Valuator v1
Probe, utility, influence, ablation, calibration
WP3
Generator v1
Contrast, near-retain, coverage, verifier
WP4
Meta / OPD
Episode history와 selected student correction
WP5
통합 실증
On-device profile, rollback, signed package
Q1에서 포화 trade-off가 재현되지 않으면 capacity reuse 대신 data-efficient update로 범위 조정
Decision & Success
승인 요청: ARF-Bench core와
제품 tool stream 파일럿 착수
신규 능력
+5%p최강 static baseline 대비 acquisition 또는 token −20%
핵심 보존
≤ 2%pBusiness-weighted retain 성능 하락
Tool 실행
≥ 90%신규 API 성공률, critical safety regression 0건
추적성
100%Source→sample→batch→model→eval lineage
최종 자산은 특정 모델 하나가 아니라, 제품군에 반복 적용할 데이터 의사결정 엔진과 package 규격
Selected References
선행연구는 구현 목적이 아니라
과제 설계의 근거다
Continual learning · data selection
Unlearning · retention
- TOFU · controlled forget/retain benchmark
- MUSE · six-way unlearning evaluation
- Which Retain Set Matters? · near-neighbor damage
- Erase or Hide? · suppression vs removal
On-policy · on-device
- GKD · on-policy student distillation
- On-Policy Prefix Distillation · selective reasoning prefixes
- K-Merge · bounded on-device adapter storage
- Knowledge Capacity Scaling Laws
Political symmetry stress-test
- Bias in the East, Bias in the West · U.S./China bilingual pairs
- IssueBench · 2.49M realistic political prompts
- What Is Said and How It Is Said · content and style
- Fair or Framed? · asymmetry and quote fidelity
상세 과제 제안과 전체 참고문헌: llm-continual-learning-samsung.md