목록인물보드종목통계

Building Anthropic: A conversation with our co-founders

2024-12-20 · 인터뷰 · 다리오 아모데이 (Anthropic CEO) · 원본
GOOG - GOOGLE
목 차
목차

제공된 유튜브 영상 'Building Anthropic | A conversation with our co-founders'의 전체 스크립트를 요청하신 대로 매우 상세하게 정리했음.

Building Anthropic | A conversation with our co-founders


앤스로픽 공동 창업자들의 AI 입문 계기


AI의 심각성 인지와 스케일링 법칙


초기 안전 연구와 GPT-2 출시


"AI 안전성의 구체적인 문제들" 논문의 배경


헌법 AI (Constitutional AI)


AI 연구 문화: 비전의 부재와 변화


AI에 대한 인식 변화


창업자들의 초기 AI 커리어 (2010년대 중반)


책임 있는 스케일링 정책 (RSP - Responsible Scaling Policy)

RSP의 핵심 역할

  1. 조직의 통합 (Dario):
    • RSP는 조직의 통합을 강제함.
    • 만약 어떤 부서가 안전 가치와 어긋나는 일을 하려 하면, RSP가 그들의 작업을 물리적으로 '차단'함.
    • 안전을 단순한 구호가 아닌 실제 '제품 요구사항'으로 만듦.
  2. 외부 소통 및 명확성 (Tom, Daniela):
    • (Tom) 상원의원들에게 RSP를 설명하면 "그거 당연히 해야 하는 일 아닌가요?"라는 반응이 옴. RSP를 지루하고, 평범한 회계 감사 과정처럼 만드는 것이 목표.
    • (Daniela) 명확성을 제공함. 회사가 무엇을 목표로 하는지 내외부에 명확히 보여줌. "안전 때문에 X를 못한다/해야 한다"는 식의 모호한 주장을 방지함.
    • (Daniela) 과도한 걱정 방지. (양치기 소년 비유: 화재경보기가 매주 울리면 실제 불이 났을 때 아무도 신경 쓰지 않음).
  3. 건강한 인센티브 (Chris):
    • (내부) 안전에 진전이 없으면 다음 단계로 진행이 막히므로, 모든 팀이 안전에 신경 쓰도록 인센티브를 부여함.
    • (외부) 만약 "모델이 위험해 중단한다"는 어려운 결정을 내려야 할 때, 그 결정이 즉흥적이 아니라 명확한 증거와 사전에 합의된 프레임워크(RSP)에 기반하게 함.
  4. 회색 지대 대응 (Dario, Jared):
    • (Daniela) RSP 구현의 가장 큰 어려움은 '회색 지대'임. 명확히 위험하거나 안전한 영역 외에, 새로운 기술의 모호한 부분이 너무 많음.
    • (Dario) 회색 지대는 예측 불가능함. 유일한 방법은 일단 모든 것을 '구현'해보고 무엇이 잘못되는지 직접 보는 것. 판돈이 커지기 전에 초기에 반복을 많이 해야 함.
  5. 실무 적용 (Evals, Policy, Tone):
    • (Jared) (컴퓨팅 담당자로서) 외부 파트너(AI 속도에 대해 다른 견해를 가짐)와 소통 시 유용함. "정말 심각해지기 전까진 극단적 조치를 안 한다"고 명시하므로 합의점 도출이 쉬움.
    • (Evals) 모든 팀이 Evals(평가)를 수행함. 모델이 위험한 능력(Chain of Thought, Tool use 등)을 갖게 되었는지 'Frontier Red Team' 등이 끊임없이 측정함.
    • (Tom) '안전'이라는 추상적 개념을 "배포 여부를 결정하는 구체적인 평가"로 만듦. 정책 입안자, 국가 안보 전문가(CBRN 등)와 협력하여 이 평가 기준을 함께 보정함.
    • (Daniela) RSP의 '톤'이 중요함. 초기엔 지나치게 기술 관료적/적대적이었음. 모든 직원이 쉽게 이해하고 참여하고 싶은 시스템으로 만들어야 함. (공장 직원이 안전벨트 문제를 발견하고 쉽게 보고할 수 있듯이).

앤스로픽 창업 동기: 사명감과 신뢰


앤스로픽의 문화: 낮은 정치, 통합, 실용주의


핵심 베팅: '정상으로의 경쟁 (Race to the Top)'


미래에 대한 기대

관련 글
다리오 아모데이 — 앤트로픽 풀다큐 (창업·Claude 철학·일자리·국방·Mythos) (2026-06-24 · 인물 다리오 아모데이)
다리오 아모데이 Bloomberg 인터뷰 — Anthropic의 AI 경쟁·컴퓨트·국방 전략 (2026-06-17 · 인물 다리오 아모데이)
다리오 아모데이 — 지수곡선의 끝: AGI 1-3년 직감과 컴퓨트 경제학 (2026-02-13 · 인물 다리오 아모데이)
A Cheeky Pint with Anthropic CEO Dario Amodei (2025-08-06 · 인물 다리오 아모데이)
정적 공유본 · 2026-08-06 생성