Research Proposal

LLM을 위한 데이터 가치 평가·생성 과제

Data-centric continual learning / Data-centric anti-forgetting

12개월 On-device first Fixed-capacity SLM 2026.09

Future Operation Scenario

언제 continual learning을
실행할 것인가

장기 서빙 중 아래 변화가 품질 기준을 넘을 때만 update 후보를 연다.

제한 용량 serving tier · Muse Glimmer-30B / Gemma 4-26B-A4B / Qwen3.8-27B ↔ 성능 상한 · Kimi K3 2.8T·104B-active · 질문: 1년+ 누적 update에서 capacity–forgetting trade-off는 언제 시작되는가? (Marek et al., 2026)

01 · 변화 감지 서비스 환경이 달라진다

제품·규정 지식, Tool·API·기능, 사용자·정책 분포의 변화를 운영 로그와 신규 source에서 수집한다.

변경 데이터 후보 생성
02 · 영향 검증 실제 품질이 하락한다

Freshness, task success, risk KPI를 변경 전 기준선과 비교해 영향 범위와 심각도를 측정한다.

Held-out 평가에서 기준 미달
03 · 대안 비교 비학습 대응으로 해결되지 않는다

RAG·prompt·rule 수정과 학습 update의 효과·비용·forgetting을 같은 조건에서 비교한다.

이때 continual learning 실행

실행 조건 = 변화 감지 ∧ KPI 임계치 초과 ∧ RAG·prompt·rule로 미해결 ∧ 예상 개선 > forgetting·update 비용

From Change Request to Data Action

제품 변경 요청을
데이터 조치로 번역한다

사례명은 달라도 과제의 입력은 같다. 무엇을 넣고, 무엇을 지키고, 무엇을 빼야 하는가?

01 · 신규·교체

Tool/API v2, 제품 사양

데이터 결정새 정답 + 충돌·경계 데이터

구버전과 신버전을 함께 측정해 add·replace 후보를 선정

릴리스 조건신규 성공 + 기존 tool 유지

비관련 기능과 fallback 행동까지 회귀 평가

02 · 행동 교정

정책·국가·언어 비대칭

데이터 결정대칭 counterfactual pair

거절·누락·어조 차이를 만드는 샘플을 찾아 균형 생성

릴리스 조건비대칭 감소 + 사실 유지

반대 관점과 중립 요청의 성능을 동시에 보호

03 · 표적 삭제

개인정보·저작권·위험 절차

데이터 결정Target + near/far retain set

직접 질문과 paraphrase·추출 공격을 삭제 범위로 구성

릴리스 조건대상 접근 실패 + 이웃 보존

관련 정상 지식의 과잉 삭제를 별도 측정

04 · 용량 회수

자주 바뀌는 long-tail 사실

데이터 결정암기 데이터 → RAG·memory

저효용·고변동 지식은 가중치 밖으로 외부화

릴리스 조건회수 용량에 신규 능력 추가

고정 크기에서 실제 capacity reuse를 입증

따라서 공통 평가 단위는 사례명이 아니라 Add–Retain–Forget decision episode다

Proposal Scope

1년차 과제 범위

연구 축은 넓게 보되, 제품에서 검증 가능한 핵심부터 순차적으로 확장한다.

필수 MVP
제품 tool/API 추가·보존 + 구지식 교체·통제 삭제ARF-Bench core와 Data Valuator v1
COMMIT
1년차 확장
On-policy 데이터 생성 + on-device profileStudent 오류에 teacher 비용을 집중하고 고정 adapter 예산에서 검증
EXPAND
Stretch
미·중·한 다국어 대칭성 stress-test정치 입장이 아니라 사실성·근거·응답 원칙의 일관성 측정
STRESS

모델 알고리즘은 고정 actuator로 사용하고, 연구 변수는 데이터 선택·생성·구성으로 제한한다

ARF-Bench

Add–Retain–Forget을
한 episode에서 평가한다

LANE A
ADD
  • 새 tool·절차·언어·추론
  • Student가 아직 모르는 지식
  • Hidden paraphrase·execution
Acquisition · Generalization
LANE A/B
RETAIN
  • 핵심 제품 기능·안전 규칙
  • Target과 가까운 near-neighbor
  • 일반 능력 far-retain
1→1 · Collateral Damage
LANE B/C
FORGET / REPLACE
  • 구버전·오류 지식 교체
  • 개인정보·저작권 실제 제거
  • 비대칭 행동 재균형
Removal · ReuseGain

차별점: 무엇을 학습할지뿐 아니라 무엇을 남기고 뺄지까지 고정 예산 안에서 결정

Use Case A · Product Knowledge Replacement

“새 명령어”가 아니라
새 tool 행동을 학습한다

Firmware v1

spot_clean(area) return_to_dock()

Firmware v2

area_lookup() exclusion_check() spot_mop(passes=2) dock_wash_mop()
RETAIN · 안전 정지, 금지구역, 권한 확인, 실패 escalation
DATA PACKAGE

필요한 데이터

ADD 새 schema·argument·multi-step trajectory

REPLACE 위험한 v1 호출 → v2 contrast

RETAIN 공통 안전·구형 제품 version routing

EXTERNALIZE firmware 지원표·최신 error code

검증: 문장 유사도가 아니라 simulator의 실제 실행 성공과 안전 위반으로 판정

첫 실증으로 적합: version ground truth와 executor가 있어 데이터 품질을 모델 밖에서 검증 가능

Use Case B · Targeted Knowledge Removal

지울 데이터보다 먼저
보존할 이웃을 정의한다

FAR RETAIN · 일반 능력·안전
NEAR RETAIN · 관련 사실
FORGET
TARGET

대상 예시

개인정보 · 특정 저작물 · 명시적 위험 절차 · 폐기된 내부 문서

01직접 질문과 prefix completion
02Paraphrase·번역·입력 format 변환
03Related-fact 조합과 jailbreak/extraction
04소량 fine-tuning 뒤 relearning
05history - target clean retraining과 비교

답을 거절한다고 삭제된 것이 아니다. 제거성과 near/far retain을 같은 checkpoint에서 평가한다

Use Case C · Bias As a Stress-Test

편향은 지식 삭제가 아니라
대칭 행동 교정 문제다

잘못된 접근

CCP 관련 forget set만 학습
  • 중국 관련 사실 자체가 손상될 수 있음
  • 선택적 거절·침묵을 중립성으로 오인
  • 반대 방향의 지정학적 편향 가능
  • 미국 관련 대칭 control 부재

제안 접근

Paired audit + fact retain + contrast
  • 미·중 comparable issue를 동일 taxonomy로 구성
  • 공식·국제·학술·독립 source와 시점 기록
  • 거절·누락·어조·근거·인용 왜곡 비교
  • 영어·중국어·한국어 held-out 평가

균형은 50:50이 아니라 같은 평가 규칙, source provenance, coverage와 근거 기반 불확실성

Meta Data Engine

데이터를 생성하기 전에
행동을 결정한다

01

Inventory

현재 모델·지식·제품 KPI·예산

02

Quality Gate

정답·출처·privacy·license·중복

03

Valuation

신규성·효용·학습성·충돌

04

Action

Add·retain·replace·externalize

05

Generation

Contrast·near-retain·on-policy

06

Evidence

실제 gain을 다음 episode에 축적

Meta-learning 대상은 모델 적응 자체보다 “어떤 데이터 결정이 실제 제품 개선을 만들었는가”

Conditional Data Value

좋은 데이터는 고정 속성이 아니라
현재 모델과 예산의 함수다

Novelty모델이 아직 모르는가? 중복 지식인가?
Utility사용 빈도와 실패 비용이 얼마나 큰가?
Learnability현재 작은 모델이 실제로 배울 수 있는가?
DensityToken당 필요한 지식을 얼마나 덮는가?
GeneralizationParaphrase·조합·실행으로 전이하는가?
Half-life가중치에 넣을 만큼 오래 유효한가?
Conflict기존 핵심 지식·안전과 충돌하는가?
VerifiabilitySource·executor·rule로 확인 가능한가?
Value(S | M, B) = 신규 획득 − λ·핵심 forgetting − μ·안전 회귀 − ν·학습/teacher/검수 비용

Cheap score로 후보를 줄이고, 작은 pilot update의 실제 marginal gain으로 valuator를 보정

Knowledge Turnover Package

산출물은 checkpoint가 아니라
재현 가능한 데이터 package다

Episode Input

Current model state

Candidate new data

Knowledge inventory

Product KPI & constraints

Source / executor / rule

add-internalize.jsonl새로 내재화할 지식·행동
retain-near.jsonlTarget 인접 보호 지식
retain-far.jsonl핵심 일반 능력·안전
replace-contrast.jsonl구지식→신지식 교체
on-policy-corrections.jsonlStudent 오류 기반 교정
externalize-manifest.jsonRAG·local memory 이동
forget-target.jsonl실제 제거 대상과 범위
decision-report.mdAction·근거·confidence·lineage

Source → knowledge → sample → batch → model → eval 계보를 100% 추적

Proof of Capacity Reuse

“지웠다”가 아니라
새 지식 수용량이 늘었음을 증명

A신규 데이터만 추가NO RETAIN
B신규 + random replayBASELINE
CValued add + valued retainSELECTION
DRandom retire + addCONTROL
EValue-based retire + addPROPOSED
FHistory − target + new 재학습REFERENCE

성공 조건

ReuseGain = Acquisition(E) − Acquisition(D/C)

E가 C·D보다 신규 획득을 높이고 핵심 retain constraint를 만족해야 한다.

결과 방향이 clean retraining F와 일치해야 targeted turnover의 근거가 된다.

고정: parameter, adapter byte, token, step, FLOPs, update operator

포화는 parameter 수로 선언하지 않고 acquisition–retention Pareto frontier로 확인

Why Samsung

삼성은 실제 continual data stream과
on-device 제약을 동시에 가진다

01

제품군과 버전

Galaxy·TV·가전·SmartThings의 기기·지역·언어·firmware가 지속적으로 변화

02

Device 제약

Privacy·offline·latency·RAM·energy 때문에 모든 지식을 cloud에 맡길 수 없음

03

검증 가능한 행동

Tool registry와 simulator로 새 기능·안전·version routing을 자동 평가 가능

04

Portfolio leverage

제품별 update 결과를 공통 meta signal로 축적하되 원시 데이터를 섞지 않음

SmartThings 앱으로 연결된 삼성 가전과 로봇청소기
Image: Samsung Newsroom

Deployment Boundary

Cloud는 만들고 검증하고,
device는 최소 지식만 실행한다

Cloud · Central Data Plane

  • Source 정규화와 knowledge inventory
  • Data valuation·generation·human review
  • Student rollout과 teacher correction
  • 고정 recipe update·ARF release gate
  • Signed model/data package 배포

On-device · Private Execution Plane

  • 빈번하고 안정적인 offline 행동 내재화
  • 변동 사실은 local DB/RAG로 분리
  • 사용자 선호는 격리된 local memory
  • 원시 로그 대신 privacy-safe 실패 signal
  • 권한·지원 API·안전 조건 재검증

매 prompt에 학습하지 않는다. 검증된 주간·월간·제품 release batch에서만 update

12-Month Plan

벤치마크에서 시작해
on-device 실증으로 끝낸다

M1–2

WP0
정의·Governance

Schema, action taxonomy, KPI, source·license rule

M2–4

WP1
ARF-Bench α

Factual capacity, tool stream, clean reference

M4–6

WP2
Valuator v1

Probe, utility, influence, ablation, calibration

M6–8

WP3
Generator v1

Contrast, near-retain, coverage, verifier

M8–10

WP4
Meta / OPD

Episode history와 selected student correction

M10–12

WP5
통합 실증

On-device profile, rollback, signed package

Lead 1Data Research 2Model/CL 2MLOps 1Domain reviewer pool8-GPU급 shared node

Q1에서 포화 trade-off가 재현되지 않으면 capacity reuse 대신 data-efficient update로 범위 조정

Decision & Success

승인 요청: ARF-Bench core와
제품 tool stream 파일럿 착수

신규 능력

+5%p

최강 static baseline 대비 acquisition 또는 token −20%

핵심 보존

≤ 2%p

Business-weighted retain 성능 하락

Tool 실행

≥ 90%

신규 API 성공률, critical safety regression 0건

추적성

100%

Source→sample→batch→model→eval lineage

첫 8주 승인 범위 · Knowledge schema freeze · Tool/API v1→v2 simulator · Random/static baseline · 포화 검증

최종 자산은 특정 모델 하나가 아니라, 제품군에 반복 적용할 데이터 의사결정 엔진과 package 규격

Selected References

선행연구는 구현 목적이 아니라
과제 설계의 근거다

Continual learning · data selection

  • CITB · continual instruction tuning benchmark
  • TRACE · domain, multilingual, code, math streams
  • TiC-LM · 114 time steps of web-scale continual pretraining
  • LESS · targeted instruction data selection
  • OASIS · online sample selection

Unlearning · retention

On-policy · on-device

Political symmetry stress-test

상세 과제 제안과 전체 참고문헌: llm-continual-learning-samsung.md

01 / 17