딥트윈 1강 · 양실장의 바이브코딩대학 (2026-09-08)

피드백을 규칙이 아니라 정답으로 준다 — 같은 반복, 다른 갱신 대상

두 루프 모두 "결과 → 피드백 → 재시도"다. 차이는 피드백의 형태(지시문 vs 내 버전의 결과물)와, 그것으로 무엇을 갱신하느냐(스킬의 규칙 vs 에이전트 그래프)에 있다. 아래 딥트윈 루프는 발표자가 "상상한 툴"이라고 전제한 설계 가설이다.

지금의 방식 — 형식지를 형식지로 갱신

Q1 50% → 90%, 그러나 Q2에서 60%, 지침이 쌓이면 Q1도 80%로 후퇴
SKILL.md입력 → 프로세스 → 산출. 하지 말 것, 집중할 것이 쌓인다
→
작업 Q제안서 에이전트에 고객사 정보·패키지·템플릿·코멘트
→
결과 R"내가 혼자 했다면 나올 품질"과 다르다
→
피드백 = 지시문"이 부분이 부족해, 앞으로는 이렇게 판단해"
↺ 지시문이 스킬의 규칙으로 추가된다. 하나 찌르면 하나가 안 되고, 결국 새로 만든다. 멀티 에이전트로 쪼개도 0.999ⁿ → 0

딥트윈 — 정답과의 차이(로스)로 그래프를 갱신

딥러닝의 학습 구조를 빌림: 정답을 가리고 예측 → 틀린 정도(로스) → 반복으로 로스를 낮춘다
그래프 0사용자가 30분 말한 업무 과정을 도구가 그래프로 그려 확정
→
작업 Q같은 작업을 넣는다. 결과 R1은 처음엔 나쁘다
→
피드백 = 내 버전"나였다면 이렇게 냈다"는 결과물만. 바꾸라는 말 없음
→
로스 → 그래프 1-1R1과 내 버전의 차이를 줄이도록 그래프 내부를 바꾼다
↺ 같은 Q를 그래프 1-1에 넣어 R1-1 → 같은 피드백과 대조 → 로스 1-1 … 기울기가 완만해질 때까지. 남는 것이 딥트윈의 "암묵지" (형태는 미공개)
왜 형식지로는 안 된다고 보는가"저 그림이 왜 좋아?"의 답을 그대로 다른 그림에 대입해도 좋고 싫음은 예측되지 않는다. 판단의 대부분은 말로 옮길 수 없는 암묵지다. 지시문 피드백은 형식지를 형식지로 업데이트하는 뺑뺑이다.
딥러닝에서 얻은 단서로스를 낮춘 것은 사람의 규칙이 아니라 알고리즘의 반복이었다. 결과인 모델 파일은 규칙이 아니라 의미를 알 수 없는 숫자인데 정답을 맞힌다. 그 자리에 "형식지만 아니면" 무엇이 와도 될 것이라는 가설.
출처: 양실장의 바이브코딩대학 유튜브, 한국어 자동자막 2:46–9:50 · 10:30–14:40 · 19:51–27:10 (조회 2026-09-19)© 2026 BuildnWrite. All rights reserved.