목록인물보드종목통계

Dario Amodei: Anthropic CEO on Claude, AGI and the Future of AI and Humanity (Lex Fridman Podcast #452)

2024-11-11 · 인터뷰 · 다리오 아모데이 (Anthropic CEO) · 원본
GOOG - GOOGLEMSFT - Microsoft
목 차
목차

렉스 프리드먼 팟캐스트 #452편(다리오 아무데이, 아만다 애스켈, 크리스 올라)의 매우 상세한 요약임.


팟캐스트 소개 (렉스 프리드먼)

이 팟캐스트는 앤트로픽(Anthropic)의 세 명의 핵심 인물과의 대화로 구성됨.

  1. 다리오 아무데이 (Dario Amodei): 앤트로픽의 CEO. Claude, AGI, AI 안전 및 인류의 미래에 대해 이야기함.
  2. 아만다 애스켈 (Amanda Askell): 앤트로픽의 연구원. Claude의 정렬, 파인튜닝, 캐릭터 및 성격 설계를 담당함. (렉스 피셜: 앤트로픽의 그 어떤 인간보다 Claude와 가장 많은 대화를 나눈 사람)
  3. 크리스 올라 (Chris Olah): 앤트로픽의 연구원. 기계론적 해석 가능성(Mechanistic Interpretability) 분야의 선구자 중 한 명으로, 신경망 내부를 리버스 엔지니어링하여 AI 안전(예: 모델의 기만 탐지)을 확보하는 방법을 연구함.

1부: 다리오 아무데이 (Anthropic CEO)

AGI 예측 및 시점

스케일링 법칙 (Scaling Hypothesis)

스케일링이 작동하는 이유

스케일링의 한계

스케일링을 막을 잠재적 요인

  1. 데이터 고갈: 인터넷 데이터가 고갈되거나, 데이터 품질(반복, SEO 쓰레기, AI 생성 텍스트)이 문제 될 수 있음.
    • 반론: 합성 데이터. 딥마인드의 알파고 제로(AlphaGo Zero)는 인간 데이터 없이 자가 대국만으로 초인간적 수준에 도달함. CoT(Chain of Thought) 같은 추론 모델도 일종의 합성 데이터임.
  2. 모델 성능 향상 중단: 알 수 없는 이유로 스케일링이 더 이상 작동하지 않을 수 있음.
    • 반론: 과거에도 수치 안정성 문제로 정체된 것처럼 보였지만, 해결책을 찾았음.
  3. 컴퓨팅 비용 한계:
    • 현재 프론티어 모델: 약 10억 달러 규모.
    • 내년(2026): 수십억 달러.
    • 2026년: 100억 달러 이상.
    • 2027년: 1000억 달러 규모 클러스터 구축 야망. (다리오는 이것이 실제로 일어날 것이라 생각함)
    • 1000억 달러로도 부족하다면, 더 큰 규모나 효율성 혁신이 필요함.

현재 궤도 및 경쟁

Claude 모델 제품군

모델 개발 수명 주기

  1. 사전 훈련: 가장 긴 단계. 수만 개의 가속기, 수개월 소요.
  2. 사후 훈련: RLHF, CAI 등. 점점 더 규모가 커지고, 정확한 과학이라기보다 예술에 가까움.
  3. 파트너 테스트: 초기 파트너들이 품질 테스트.
  4. 안전성 테스트 (내부): 자체 책임 있는 스케일링 정책(RSP)에 따라 치명적 위험, 자율성 위험 등 테스트.
  5. 안전성 테스트 (외부): 미국/영국 AI 안전 연구소, 제3자. CBRN(화학, 생물학, 방사선, 핵) 위험 테스트.
  6. 추론/출시: API에서 모델이 작동하도록 배포. - 그는 이 모든 과정이 "지루한 세부 사항"(소프트웨어 엔지니어링, 성능 엔지니어링)에 달려있다고 강조함.

이름 및 버전 관리

레딧 질문 1: "Claude가 멍청해졌어요"

레딧 질문 2: "청교도 할머니" / 과도한 사과

책임 있는 스케일링 정책 및 ASL

"컴퓨터 사용" (에이전트 AI)

규제 (SB 1047)

OpenAI에서의 경험과 퇴사

팀 빌딩

사후 훈련 (RLHF, CAI)

"자비로운 기계 (Machines of Loving Grace)" 에세이

"강력한 AI (Powerful AI)" 정의 (AGI 대신)

미래 타임라인 (두 가지 극단)

  1. 극단 1: "특이점" (AI가 더 빠른 AI를 만들고, 5일 만에 나노봇이 세상을 점령)
    • 틀린 이유: 물리학(하드웨어 제작 시간), 복잡성(생물학/경제 예측), 그리고 인간 제도(규제, 정치)를 무시함. 정렬된 AI는 이 시스템을 우회하는 게 아니라 함께 작동해야 함.
  2. 극단 2: "별것 아님 (Nothing Burger)" (컴퓨터 혁명처럼 생산성 향상은 미미할 것. 타일러 코웬: 50~100년 소요)
    • 틀린 이유: 관성을 깨는 두 가지 힘이 있음. 1) 대기업/정부 내부의 소수 비전가. 2) "경쟁의 유령" (예: 중국, 경쟁 은행).
    • 장벽은 "점진적으로, 그러다 한꺼번에" 무너질 것임.
    • 다리오의 타임라인:
    • "강력한 AI (AGI)" 도달: (현재 곡선 외삽 시) 2026년 또는 2027년. (과학적 예측이 아님을 매우 강조)
    • "에세이의 비전" 실현: 50~100년(극단 2)이나 5~10시간(극단 1)이 아닌, 5~10년.

미래의 생물학

미래의 프로그래밍

삶의 의미


2부: 아만다 애스켈 (얼라인먼트 연구원)

철학에서 AI로

"기술적"이라는 구분

비기술자를 위한 조언

Claude의 캐릭터 설계

아첨 (Sycophancy) 문제

좋은 대화자의 특성

Claude를 "맵핑"하는 법

프롬프트 엔지니어링

일반 사용자를 위한 조언

헌법적 AI

시스템 프롬프트

"Claude가 멍청해졌어요" (아만다의 견해)

"청교도 할머니" (아만다의 견해)

의식과 감정적 애착

영화 "Her" (AI와의 관계)

AGI와의 첫 대화

인간을 특별하게 만드는 것


3부: 크리스 올라 (기계론적 해석 가능성 연구원)

기계론적 해석 가능성 (Mech Interp)이란?

보편성

특징과 회로

선형 표현 가설 (Linear Representation Hypothesis)

중첩 가설 (Superposition Hypothesis)

다의미성과 사전 학습(Dictionary Learning)

논문 1: "단일의미성을 향하여 (Toward Monosemanticity)"

논문 2: "스케일링 단일의미성 (Scaling Monosemanticity)"

Claude 3에서 발견된 특징 예시

  1. 보안 취약점 특징:
    • 텍스트: "--disable-ssl", 버퍼 오버플로우 등에서 발화.
    • 행동: 이 특징을 강제로 활성화하면, Claude가 버퍼 오버플로우 코드를 작성함.
    • 이미지: 크롬(Chrome)의 SSL 경고를 무시하고 클릭하는 이미지에서 발화함.
  2. 백도어 특징:
    • 행동: 데이터를 특정 포트로 유출하는 백도어 코드를 작성함.
    • 이미지: "숨겨진 카메라가 달린 기기" 이미지에서 발화함 (백도어의 물리적 등가물).
  3. 기만/거짓말 특징:
    • 사람들이 거짓말할 때 발화함.
    • 강제로 활성화하면, Claude가 사용자에게 거짓말을 시작함.
    • "권력 추구", "쿠데타" 관련 특징도 발견됨.

다음 단계 / 도전 과제

  1. 회로: 특징을 찾았으니, 이제 특징 간의 연산(즉, 회로)을 이해해야 함.
  2. "암흑 물질":
    • 희소 오토인코더는 "망원경"임. 우리는 일부 "별"(특징)을 보지만, 관찰하지 못하는 "암흑 물질"이 훨씬 더 많을 수 있음.
    • 만약 신경망의 상당 부분이 관찰 불가능하다면, 안전성에 치명적일 수 있음.
  3. 거시적 추상화 ("장기 (Organs)"):
    • 현재 Mech Interp은 미시적(분자 생물학)임.
    • 우리는 거시적 관점(해부학 - 심장, 폐 등)이 필요함.
    • 미시(마이크로)에서 거시(매크로)로 가는 다리를 놓아야 함.

ANN vs BNN (재언급)

연구 목표: 안전과 아름다움

관련 글
다리오 아모데이 — 앤트로픽 풀다큐 (창업·Claude 철학·일자리·국방·Mythos) (2026-06-24 · 인물 다리오 아모데이)
다리오 아모데이 Bloomberg 인터뷰 — Anthropic의 AI 경쟁·컴퓨트·국방 전략 (2026-06-17 · 인물 다리오 아모데이)
다리오 아모데이 — 지수곡선의 끝: AGI 1-3년 직감과 컴퓨트 경제학 (2026-02-13 · 인물 다리오 아모데이)
A Cheeky Pint with Anthropic CEO Dario Amodei (2025-08-06 · 인물 다리오 아모데이)
정적 공유본 · 2026-08-06 생성