EP 116
창의성을 배운 AI (Opus 5.5·GPT-6 Sol)
모델 발표 러시 속에서 커지는 철학적 담론 00:00
노정석 녹화를 하고 있는 오늘은 2026년 9월 27일, 일요일 아침입니다. 이번 주에도 어김없이 모델들이 많이 발표되었는데요. GPT-6 Sol도 나왔고 또 중국에서는 샤오미의 MiMo 모델이 나왔고 MiMo 페이퍼가 굉장히 좋은 내용들을 많이 담고 있더라고요. 그리고 Anthropic도 Claude Opus 5.5 모델을 내놓았죠. 모델들의 발표 주기가 계속 빨라지고, 나올 때마다 어떤 거대한 능력 향상을 기대하는 게 기본값이 되어 버린 것 같아요. 이런 단계에서 도대체 인간은 무얼 해야 되는가, 또 AI가 인간을 지배하지는 않을 건가, 속도 조절에 대한 이야기도 굉장히 많이 나오고 있고 굉장히 복잡한 이야기들이 쏟아져 나오고 있는 중인데 아직 커뮤니티가 어떤 방향을 정한 것 같지는 않아요. 그래서 대단한 혼돈 상태를 넘어가면서 우리는 무엇을 해야 될 것인가, 또 이 프론티어 랩, 프론티어 랩이 프론티어 코퍼레이션, 이런 의미로 바뀌어 불리고도 있는데 그들에게는 무엇을 기대해야 되고 어떠한 의무를 지워야 되는가, 이런 이야기들. 기술적인 이야기들보다는 철학적인 이야기들이 담론을 많이 형성하는 것을 보게 되는 것 같습니다.
그럼에도 불구하고 저희가 오늘 모델 이야기를 전반적으로 살피기보다는 Opus 5.5가 가지고 있는 어떤 능력을 중심으로 해서 이런저런 실험들을 하셨거든요. 그래서 그런 부분들 이야기로 시작을 하면서 Opus 5.5 이야기 해보도록 하겠습니다.
Claude Opus 5.5와 감당하기 어려운 발전 속도 01:34
최승준 저도 머릿속에 아직 정리가 안 되어 있고 지금 교육 쪽에 원고를 하나 보내야 되는데 마감을 넘겨서 계속 고민을 하고 있습니다. 정리가 안 돼서 어디에 포인트를 줘야 될지 계속 오락가락하고 있거든요.
그런데 요새 Opus 5.5가 나온 다음에 창작 쪽에서도 그런 분위기가 있어요. 그래서 먼저 모델 관련된 거를 한번 저희가 늘 보기는 했었으니까 이제는 자세히 들여다보지는 않지만 그래도 견디는 느낌으로 보고 있긴 하거든요. 이 정보의 양과 빈도를 그래도 나는 견디기로 했다. 그래서 그런 태도로 기계적으로 임하고 있습니다.
1년을 버티지 못하는 벤치마크와 촘촘해지는 RL 02:18
최승준 그래서 이번에는 시스템 카드까지 찾아보진 않았고, 대강 봤을 때 주기로 보면 70일 정도예요. 그리고 제가 이번에 조사를 시켜본 것에서 재미있었던 거는 Opus 5가 나온 게 60일 전이었고, 그래서 지금 나왔는데 벤치마크들이 어떻게 유지되나 봤는데 벤치마크들을 1년 정도 기간으로 비교하려고 그랬는데 1년 동안 살아남는 게 있긴 있지만 벤치마크 자체도 변하고 있어서 1년을 보기가 어렵더라고요. 그래서 HLE는 아직 살아남았는데, 이것도 오염이라 Humanity’s Last Exam이라고 해가지고
노정석 Humanity’s Last Exam.
최승준 그래서 HLE는 아직 살아남긴 했는데 이번에 GPT-6 Sol은 이거 조사했을 때는 안 나왔을 텐데 아마 지금은 나와 있을 거예요. 그래서 계속 상승이 있는 거고 그다음에 이렇게 없어진 것들이 있다는 게 또 포인트인 것 같아요. 그러니까 없어졌다는 거는 새로 생기기도 했거든요. 많이요.
그래서 RL을 가지고 촘촘하게 그 간격들을 채우고 있다. 그래서 이게 완전히 일반화돼 있지는 않지만 RL 환경을 만들고 거기다가 때려 부으면 향상이 일어나는 추세가 있는데 Opus에서 재밌는 거는 1년 전에 Opus 4.1이 가격이 꽤 비쌌어요. 입력 15달러, 출력 75달러. 그런데 지금 4달러, 20달러예요. 입력 4달러, 출력 20달러.
가격 경쟁과 medium으로 충분해진 프론티어 성능 03:38
노정석 거의 3분의 1, 4분의 1 가까이 떨어졌네요.
최승준 그런데 이번에 GPT-6 Sol의 경우도 낮아졌어요. GPT-5.6 Sol은 프로모션해서 4달러, 20달러였거든요. 그런데 절반이에요. 지금 GPT-6 Sol.
박종현 그런데 과거에 Opus는 제일 큰 모델이었는데 지금은 그 위의 급이 나왔잖아요.
노정석 Fable이 나왔죠.
최승준 이것도 Astra와 비교한 게 아니라 Sol과 비교한 거죠.
노정석 Astra는 이거보다는 훨씬 비싸게
최승준 long-context에서 그냥 기본 1M에 50달러 정도, 출력이 그다음에 long-context에서는 75달러 그랬거든요. 그래서 이게 지금 가격이 Opus급이 지금 5.5, 저 요새 medium으로 쓰고 있는데 제가 쓰는 도메인에서는 상당히 성능 향상이 있거든요. medium에서 쓰기가 괜찮다, 싸다, 꽤 오래 작업을 할 수 있다. 그러니까 프론티어 단에서도 오르기만 하는 게 아니구나라는 인상이 있어요.
박종현 저도 비슷한 걸 느낀 게 예전에는 리서치 리포트를 high, xhigh 이렇게 썼어야 되는 것들이 medium에서 생각보다 잘 되더라고요. Astra도 그랬고 이번에 Opus도 그랬고 그래서 토큰당 가격만 떨어진 게 아니라 실제로 medium을 쓰다 보니까 토큰 사용량도 달라져서 체감적으로는 조금 싸진 것 같다는 느낌이 들긴 합니다. 대신에 상위 옵션이 생긴 느낌이 들긴 하죠.
최승준 RTS 하는 감각이죠. 어느 때 어느 자원을 투자해서 뭘 해내느냐인데 어쨌든 제가 체감하기로는 괜찮다. 그리고 이런 게 느낌상으로는 이것도 노리는 거 아닐까? 왜냐하면 경쟁해야 되니까 Opus, Sol 티어에서는 가격 경쟁이 좀 있을 가능성이 있다. 이게 2배 정도니까요.
항공권과 호텔을 닮은 토큰 가격 책정 05:38
노정석 이 토큰 요금이라는 게 저희가 일반적인 사업을 생각해 보면 재고를 쌓아놓고 재고를 조절하면서 팔잖아요. 그러한 재화가 있고, 비행기 티켓이라든지 호텔처럼 시간이 지나가 버리면 절대 팔지 못하는 재화가 있거든요. 그래서 여러분들 비행기와 호텔의 가격 책정이 다른 물건을 사는 것과 다르다고 느끼잖아요. 토큰은 호텔과 비행기와 같거든요. 시간이 지나가면 다시 팔 수 없기 때문에 그 단위 시간 동안 최대한 팔아야 되기 때문에 가격 책정 방식이 굉장히 역동적으로 움직이거든요. 그래서 그런 관점으로 생각해 보면 이것도 상당히 재밌습니다.
그리고 이게 또 경쟁에 영향을 받잖아요. 내가 안 팔면 다른 사람이 저 항공사를 타버리면 내가 그걸 놓치는 거라서 정해진 수요를 다 먹어야 되거든요. 그래서 이러한 가격 책정이 이 전략에 반영되는 게 저는 굉장히 재미있다고 생각합니다. 또 여기에 오픈소스와 온프레미스까지 들어오니까요.
경쟁력의 핵심이 된 컴퓨팅 최적화 06:34
최승준 어쨌든 쟁여 놓은 컴퓨터를 감가상각되기 전에 최대한 당겨 써야 된다는 거잖아요.
노정석 그래서 medium을 쓰면 2명을 수용할 수 있는데 누가 xhigh를 하면 거기는 1.5명을 수용할 수 있고, 그런 걸 최적화하고, 그런데 종현님이 갑자기 이쪽 팜에서 medium을 쓰다가 갑자기 xhigh로 바꾸거나 혹은 context length를 바꾸면 그 작업을 가지고 또 다른 팜으로 가야 되고 이런 것들을 뒤에서 조정하는 엔지니어링이 저 회사들의 엔지니어링 경쟁력이겠죠. 그리고 점점 가치의 중심이 그런 쪽으로 이동하는 것 같아요. 모델이 상향 평준화되다 보니까요.
특화 학습과 벤치마크의 한계 07:15
최승준 어쨌든 상응하는 훈련을 시키는 것 같고 최근에 성능이 향상되는 건 이게 일반화라기보다는 특화된 training을, 벤치마크를 촘촘히 하듯이 training이 촘촘해지고 있다는 느낌을 받았고 RSI를 그냥 버튼이라고 생각해서 그게 되면 audit도 다 못하는데 출시되는 문제가 생길 수 있으니까 버튼을 안 눌렀을 때를 생각해도 지금 이 추세에서도 내년 이맘때까지 현재 벤치마크가 몇 개나 남아 있을까 잘 모르겠어요.
노정석 9월이 막 끝나가고 딱 3개월 남았는데요. 저희 사실 봄부터 여름 끝까지 정말 숨 가쁘게 달려왔잖아요. 앞으로 3개월은 더 심하겠죠?
최승준 그래서 지금 70일 단위로 평균 내 가지고 프론티어에서 모델이 나온다고 하면 일주일이 10%거든요. 일주일에 10% 향상이라는 감이 좀 있습니다.
할리우드에서 실리콘밸리로의 이동을 말한 Jeffrey Katzenberg 08:10
최승준 그래서 창작 쪽에서 재밌는 게 며칠 전에 나왔던 Jeffrey Katzenberg라고, DreamWorks 창업자이자 전 CEO, Disney하고도 작업 많이 했고 해서 그분이 올린 트윗이에요. 번역을 했는데, 이렇게 세상이 변하고 있고 여기서 북쪽, 남쪽인데 북쪽이 실리콘밸리, 남쪽이 할리우드, 그런 쪽으로 비교해서 얘기를 하고 있어요. 그런데 역사의 얘기는 그동안 기술이 나오면서 이동이 있었다. 그런데 그 이동이 일어날 때 직업은 실제로 없어졌지만 그 이동이 일어나는 과정에서 그래도 싸웠던 사람들이 그 이후에 어떤 권리를 보장하는 데에는 도움이 됐기 때문에 그런 것들을 지금 해야 될 타이밍인 것 같다는 뉘앙스로 얘기를 한 게 있습니다.
그런데 어쨌든 결론은 이분도 이동한다는 거예요.
AI for Creativity: 인간의 마지막 영역이라 믿었던 창의성 09:11
노정석 창의성이라는 단어는 저희가 AI for 뒤에다 붙였던 수많은 AI for 수학, AI for 과학, 이런 것과는 다른 더 큰 의미인 것 같긴 해요. 저희가 항상 인간은 컴퓨터와 뭐가 다른데라고 하면 인간은 창의적이잖아. 이게 인간의 마지막 영역이라고 생각했는데 이제 AI for Creativity라는 단어까지 딱 박혀서 나오는 게
최승준 그게 사실 이미지나 영상 쪽에서는 조금 더 먼저 맞았는데 최근에 Opus 5.5, 좀 전에도 Astra, 이런 모델들에서 사람들이 타격을 받는 거는 코드로 창작하는 사람들. 그래서 코드로 창작하는 사람들은 개발자와 뭐가 다르냐, 개발의 영역이긴 하지만 그래도 거기에는 예술적인 부분들이 들어가고 있었거든요. 그런데 지난주, 이번 주에 그쪽 계열에서 뭔가를 맞은 듯한 반응들이 나오고 있어요.
그런데 이 Jeffrey Katzenberg의 이야기는 다가올 미래 부분을 보면 스토리텔링의 새로운 지평이 열릴 가능성이 있다. 그래서 이런 것들을 포용하는 새로운 세대의 창작자들이 폭발적으로 뭔가를 하게 되리라는 짐작을 자기의 오랜, 이분이 한 75세 정도 되는데, 그런 정도의 경험에서 얻은 감이 좀 있는 거죠.
그래서 마지막에 “분명히 나는 모든 답을 알지 못한다. 하지만 창작의 기회가 다시 한번 확장되리라 확신한다. 그래서 우리가 이 시기를 어떻게 지나갈지는 선택의 문제다.” 그래서 지금 다양한 태도들이 타임라인에 보이고 있어서 일단 거기를 한번 들여다보겠습니다.
AI 쇼츠 드라마의 확산과 플랫폼 규제 10:57
노정석 유튜브 같은 데 요새 AI로 생성한 쇼츠 클립들, 아예 시리즈로 만들어 가지고 스토리 드라마라고 그러죠? 드라마 형태로 게시되는 것들이 꽤 많이 보이는데 저도 가끔 보거든요. 그런데 꽤 이건 AI로 만들었구나라고 바로 느낄 수 있지만 품질이 그렇다고 못 봐줄 정도는 아니고, 나름의 내용과 카메라로 찍는 것으로는 절대 못 하는 세계관이나 연출들이 있잖아요. 그런 것들을 보다 보니까 자주 보게 되더라고요.
최승준 여기서 그 부분을 빼먹었는데, 여기에 동료들이 말하는 얘기가 나와요. 그래서 몇 달 전 실리콘밸리에서 테크 창업자가 보여주는 놀라운 무언가를 봤다. 그래서 그게 〈룩소 주니어〉나 예를 들면 픽사의 〈토이 스토리〉를 봤을 때와 비슷한 경험이었다는 거죠. 그런데 그에 대해 비슷한 영상을 본 30년 지기 아티스트가 “이게 우리의 끝인가요?”라고 했을 때 “절대 아니죠”라고 답했다면서 이야기를 풀어내는데, 누군가는 “이게 우리의 끝, AlphaGo moment인가?” 이렇게 얘기하는 요즘이라는 거죠.
Phenaki에서 시작된 생성 영상의 2년 12:01
최승준 그런데 2022년 11월 3일에 Alonso Martinez라고 Google X 팀에 있었나, 그랬던 분이에요. 그래서 2022년 11월 즈음에 Google에서 Phenaki라는 autoregressive 방식의 비디오 생성 모델을 만들었어요. 우주인이 뭔가를 탐험하는 걸 만들려고 텍스트를 입력했더니 되는 거예요. 그런데 이걸 봤을 때 사람들이 그냥 웃었을 거 아니에요? 품질을 봤을 때는요.
노정석 “에계?” 이랬겠죠.
최승준 그런데 문제는 AI 분야에서 귀여워 보이는 건 문제라는 거예요. 신호가 있다는 의미죠. hill climbing이 가능하다고 볼 수 있거든요. 그런데 이분의 예측이 사실 정확하지 않았어요. 번역해 놓은 게 “텍스트 투 비디오로 제작한 AI 단편 영화. 이 연구 분야의 발전 속도를 고려할 때 비슷한 기술을 사용하여 완전히 제작된 주요 TV 프로그램을 보기까지는 약 2년이 걸릴 것이다.” 2022년 말이니까 2년이면 올림해서 2025년 즈음에 일어날 거로 예측한 거죠. 이제 일어나기 시작하죠. 2025년이면 Seedance 2.0이 나왔나요? 정확하게 기억은 안 나는데.
박종현 더 전이었던 것 같긴 한데요. 저도 최근에 AI로 생성한 영상을 실제로 사람들이 즐기고 있는가, 이걸 지난주, 지지난주에 조사해 봤거든요. 가장 유명한 게 〈신비한 건축사전〉, 그 채널이 있었던 것 같은데 정말 사람들이 많이 좋아하죠. 그리고 그거 말고도 찾아보니까 고품질부터 저품질까지 엄청 다양하게 많습니다. 그리고 품질이 우리가 보기에 좀 자연스럽지 못하더라도 조회수가 엄청 많이 나오는 콘텐츠가 상당히 많더라고요.
그리고 YouTube에서는 최근에 AI로 생성한 영상을 올리는 채널들을 다 차단해서 채널을 없애기도 했더라고요. 그런데 YouTube가 어떤 영상들을 없앴나 하면, 정보가 잘 담겨 있고 그 정보를 설명하기 위해 촬영이나 CG 대신 AI를 쓴 것들은 살렸는데, 그 CG 자체라고 해야 되나요? 그냥 귀여운 고양이들이 나와서 “안녕” 하는 것들도 사실 조회수는 잘 나오거든요. 그런데 그런 것들은 YouTube가 다 차단했더라고요. 아마 플랫폼 입장에서 그게 장기적으로 해가 될 거라고 생각했나 봐요.
생성 영상의 만족감과 창의성의 의미 14:39
박종현 그래서 영상을 생성해서 어떤 것들을 할 수 있을까, 이게 창의성이랑 어떤 연관이 있을까, 생성된 영상이 사람들에게 만족감을 줄 수 있을까 하면, 그건 확실한 것 같죠. 만족감을 주고 있으니까 조회수가 나오는 거고요. 그런데 정보를 잘 전달하기 위한 수단 이외에, 창의성을 가진 영상 자체가 의미를 가질 수 있을까 하면, 아직은 그 단계가 안 온 것 같긴 해요. 그런데 곧 오지 않을까 생각합니다.
텍스트를 넘어 이미지와 영상으로 넓어진 개발 15:12
노정석 네, 시간문제라고 봅니다. 아까 말씀드리려던 건, 2022년 정도에는 이미지나 비디오, 그리고 LLM이 서로 다른 영역을 형성하고 있었거든요. 그래서 이미지랑 비디오 쪽에만 투자가 됐다면 2~3년 걸렸을 수도 있지만, 사실 그사이에 ChatGPT가 나오면서 모든 리소스가 전부 LLM으로 갔잖아요. 모두가 LLM을 하던 시기가 한 4년 있었으니까요. 그러고 나서 그걸 잘 만들어 놓으니까, 오늘 승준님이 보여주시겠지만, 그게 이제 모든 걸 다 하는 시기가 됐죠.
최승준 그래서 이번 주에 Opus 5.5와 GPT-6 Sol이 나왔는데, 같은 날 2시간 정도 차이를 두고 나왔어요. 그런데 타임라인을 뒤덮은 건, 9월 2일에는 Fable 대신 Astra였고 지금은 Opus 5.5거든요. 그래서 Astra가 나왔을 때 3D, 그래픽, 게임, 사운드 관련해서 타임라인에 보이는 걸 모아 놨어요. 한 100여 개 되는 것 같은데, 이번에는 Opus 5.5로 만든 데모들을 찾아봤는데, 그날 미리 썼던 분들이 만든 것도 있었어요.
코드만으로 만든 Opus 5.5 모션 그래픽 16:22
최승준 지금 이게 Kevin Ngo라는 분 계정인데, 이분 계정이 Claude 쪽에서도, 그러니까 Anthropic 쪽에서도 공유해 줘서 많이 회자됐는데, 이게 다 JavaScript로 만들어진 영상이에요. 소리도요. 지금 이게 어떤 느낌이냐 하면, 굉장히 복잡한 prompt가 아니라 Claude가 생각하는 “뭘 좋아하니?” 하고 물어보는 류의 창작물이 많았어요. 그런데 나름의 창의성을 가지고 만든 느낌을 받게 됩니다.
노정석 저걸 사람이 직접 만들면 After Effects 같은 motion graphics 도구를 들고 상당히 오래 해야 되는 일인 거죠.
최승준 그러니까 코드로만 만든다고 봤을 때, After Effects 같은 제작 도구가 아니라 코드로만 만든다고 했을 때는 더 가늠이 안 되죠. 이렇게 만든 걸 한번 들어가 볼까요? 이것도 Claude Opus로 만들었는데, 이거 상호작용이 가능해요. 그러니까 JavaScript로 만들어서 개입할 수 있는 작업인 거죠.
박종현 네. 저는 어떤 게 눈에 띄었냐면, 애니메이션에서 꽃이 탕탕탕탕 나왔는데, 그게 뒤에 있는 음악의 땅땅땅땅 하는 박자랑 딱 맞춰서 탁탁탁탁 떨어지더라고요. 그런데 지금까지 그런 게 잘 되는 건 사실 없었어요. 제가 그런 걸 찾고 있었거든요. 왜냐하면 잘 만들어진 영상을 보면 음악의 박자랑 애니메이션 효과가 딱딱 맞아떨어집니다.
그런데 그런 걸 제가 구현해 보려고 했는데 쉽지만은 않더라고요. 그런데 오히려 코드로 둘 다 생성하니까 더 잘돼서 그걸 oddly satisfying이라고 하잖아요, 이렇게 딱딱 맞아떨어지는 거. 그런 느낌이 들어서 괜찮다는 생각이 들었습니다.
7,500줄 Python 코드로 재현한 화가의 화풍 18:43
최승준 둘 다 코드로 만들어지기 때문에 타이밍이 딱 맞는 거고요. 그다음에 이건 개인적으로 놀랐는데, 이건 7,500줄의 Python 코드로만 그린 거예요. 그런데 화가의 화풍에 맞춰 저 brush stroke를 그렸다는 거거든요.
노정석 저 7,500줄의 Python 코드로 그림을 그렸다는 의미가 정확히 뭐죠?
최승준 그러니까 이걸 그리려면, 최근에 작고하신 그 화가분이잖아요. 어쨌든 그런 걸 하려면 회화에 대한 이해가 있어야 되거든요. 창작하는 방식으로, 그러니까 붓의 질감이나 이런 걸 수학으로 구현했다는 건데, 그냥 단순히 그린 게 아니라 대상 화가의 화풍을 모사했어요. 7,500줄 정도의 코드로요.
노정석 그 화가의 화풍이나 심상을 라이브러리로 만든 거군요.
Dark Souls와 Antikythera로 확장된 게임 데모 19:51
최승준 그러니까 그걸 재현할 수 있을 정도로 심상과 코드 사이를 중개하는 거죠. 그게 Opus 5.5에 대한 제 느낌인데, 그거 말고도 게임이나 3D 관련은 어마어마하게 많습니다. 이건 아예 Dark Souls 비슷한 걸 만들었어요. 그래서 Dark Souls 보스전 특유의 느낌이 나거든요.
그런데 이건 Opus랑 Astra를 같이 써서 만들었다고 했습니다. 그리고 Antikythera라고, 최초의 계산기를 찾아가는 스쿠버 다이버가 그 유물을 발굴하는 게임을 만든 거예요. 이거 실제로 링크에 들어가 보면 바로 플레이할 수 있습니다. 이것도 인상적이었고, 이건 Karpathy가 8월 2일에 〈반지의 제왕〉으로 한 실험인데, 저번 편에도 한번 소개해 드렸었죠.
자기가 이야기를, 물론 여기는 〈반지의 제왕〉이지만, 공부해야 할 걸 이야기로 만들어서 본다, 걸어놓고 갔다 와서 본다고 했는데, fidelity 자체, 그러니까 충실도 자체가 지금 다른 분이 한 걸 보면 훨씬 더 올라간 걸 볼 수 있죠. 그러니까 아직은 3Blue1Brown급은 아니지만, 개념을 이해하는 대화형 영상을 Ethan Mollick이 만든 거예요.
Karpathy와 Ethan Mollick의 학습용 대화형 영상 21:00
최승준 지금 이건 재귀에 대한 개념을 설명하는 거거든요. 이거 다 JavaScript인데, 말하는 건 ElevenLabs겠지만요.
노정석 저희가 한 1년 안 된 것 같은데 Remotion이라는 접근 방식을 보고 참 재밌다고 생각했었는데, 그거네요.
최승준 Remotion이랑 비슷한 걸 한 게 Claude Design에서 먼저 나왔었고, Claude Design에서 JavaScript로 애니메이션을 만드는 것에서 더 hill climbing을 한 거죠. 저도 연습해 봤는데, 5.5로 한 첫 작업이 이거 따라 하기였거든요. 이게 pixel art를 만드는 거였어요. 이걸 그냥 Opus 5.5로 클릭 몇 번에 만들었다고 해서 저도 비슷한 걸 만들어 봤습니다. 이게 소리가 좀 먼저 나오네요. 그런데 이제 voxel 버전. 이게 그냥 “해줘, 해줘”로만 나왔거든요.
노정석 그러니까요.
박종현 그런데 cutscene 전환 같은 게 잘 되는 게 신기하네요.
최승준 그걸 하라고 한 게 아니었어요. prompt는 그냥 “해줘, 해줘”였어요. 그냥 pixel로 만들고, 여러 개의 마법이 있었으면 좋겠다고 한 다음에 그다음에 그걸 voxel로 바꾸자, 그다음에는 rigging한 걸로 바꾸자. 그렇게 그냥 “해줘”로만 해온 거거든요.
박종현 네, 마법 효과를 이 각도에서 저 각도로 타이밍 맞춰 바꿔서 보여주는 게 당연히 해야 할 일이라고까지 생각했다는 것 자체가 좀 신기한 것 같습니다.
아이와 하루 만에 완성한 2시간짜리 JRPG 23:21
최승준 그래서 이게 되는 걸 보고, 이게 9월 23일이었어요. 하루 지나서 저도 해본 거긴 한데. 게임이 되겠구나 싶어서 아이랑 함께 얘기하면서 게임을 만들었습니다. 그래서 지금 이게 엔딩까지 플레이 타임이 한 2시간 되는 거거든요. 풀로 플레이할 수 있는 게임을 하루 정도에 만들었어요. 깜짝 놀랐습니다. 하여튼 JRPG류의 게임을 서사가 있고 반전이 있고 보스도 있고 플레이할 수 있는 완벽한 형태로 만드는 데 하루 정도 걸리더라고요. 그런데 이런 예가 지금 넘쳐나고 있어요.
박종현 그런데 제가 비행기를 타려고 비행기에서 무슨 게임을 할까 게임을 찾는 데만 1시간 넘게 썼거든요. 그런데 무슨 게임을 할까 찾는 게 아니라 그냥 나를 위한 게임을 만들어서 하면 되겠다는 생각이 들 것 같네요. 조금만 지나면요.
최승준 첫 프롬프트를 쓰는 데 10분 걸리고, 생성되는 데 처음에 PoC 정도로 마을에서 뭐가 나와서 모험하는 바로 옆 맵 정도 나오는 데 20분 걸렸거든요. 생성에만 도합 30분으로 시작됐던 건데 흥미로운 경험이었어요. 이게 완주까지 될 거라고는 생각하지 못했었거든요.
에셋 없이 코드로만 생성한 그래픽과 사운드 25:11
최승준 아까 그 게임이나 마법 같은 거에 에셋이 하나도 쓰이지 않았어요. 픽셀까지 다 생성했고 음악도 다 생성했거든요. 그러니까 코드로만 만들어진 거예요. 스프라이트도 다 코드로 만들고 그걸 자기가 다 한 거예요. 이미지 생성 모델이 아니잖아요. Claude는 보통 GPT로 할 때는 이미지 생성으로 텍스처를 만들고 그걸 import하는 방식으로도 많이 하는데 Claude의 경우에는 아까 그 정도 수준이 다 그냥 코드로만 그려진 거예요. 소리도요.
노정석 그러니까요.
박종현 사실적인 것도 혹시 한번 시도해 보셨나요?
최승준 사실적인 걸 시도하는 경우가 있긴 있어요. 그런데 아직은 좀 떨어지긴 한데 그래도 상당한 충실성을 갖춰 가고는 있습니다. 그러니까 그거에만 토큰을 올인하면 상당히 잘 그려요.
박종현 왜냐하면 생성한다는 건 지금 저희가 이미지를 만드는 경우에 diffusion 기반 모델은 완전히 사실적인 걸 만들어 낼 수도 있고 Seedance나 이런 것들이 다 그런 류죠. 그런데 지금은 코드를 만들어서 코드로 그림을 그리는 거니까, 코드로 그림을 그리면 왠지 사실적인 건 잘 못할 것 같다, 이런 생각이 들긴 하거든요. 그 방향으로도 갈 수 있을까 궁금하긴 하네요.
최승준 그런데 이것도 어쨌든 입력은 multimodal이잖아요. 그리고 너무 흥미로운 게, 어떻게 한 건지 모르겠는데 사운드는 못 듣거든요. 그런데 그거에 대한 representation이 없고는 이 정도를 못 만든다고 저는 생각해요. 작곡을 정말 잘해요. 그래서 깜짝 놀란 게, 그냥 PCM 그러니까 PCM이 Pulse Code Modulation이잖아요. 그래서 그걸 그냥 코드로 합성하는 데 제가 음악이나 사운드 쪽은 잘 모르지만 기초는 알고 있어서 그걸 JavaScript나 numpy로 사운드를 만들어서 쓰곤 했는데 그걸 한번 밀어붙여 보고 이 작업을 했는데 깜짝 놀랐어요. 이것도 다 코드로만 된 겁니다. 새 소리도 코드예요.
PCM 합성으로 만든 음악과 상호작용하는 서사 27:33
최승준 이게 formant라고 해서 음성 합성 비슷한 걸 하는 자음, 모음 기반의 기법인데 그걸 가지고 노래 비슷하게 해서 지금 이게 어기여차 하면서 민요의 메기고 받기, 돌림노래 같은 걸로 가거든요. 그래서 보면 주성부가 있으면 부성부에서 합창으로 그걸 받기도 하고 이게 상호작용 가능한 형태입니다. 저 중간 부분에서 깜짝 놀란 게 여기에서 멈춤을 주거든요. 클라이맥스 같은 걸 설계하더라고요.
그래서 이렇게 기승전결이 있는 이야기 구조, 그다음에 여기 얘네들도 다 상호작용이 가능한데 예를 들면, 클릭하면 날아가게 된다거나. 그래서 나중에 엔딩까지 완주하거든요. 그래서 이것도 소름 돋았었는데 제가 준 키워드가 Iannis Xenakis라고 해서 그래픽 악보 작업이 원래 있긴 했어요. 그래서 그걸 키워드로 주긴 해서 시각적인 악보를 만든 거긴 했는데 소리 합성이 이 정도로 되나, 그걸 저도 이번에 처음 알았어요. 되는구나.
창작 능력의 도약과 모델 내부의 표상 29:12
노정석 저희가 보기엔 그냥 attention과 FFN의 조합인데 그 안에 얘가 이러한 representation을 만드는 이런 것들이 돌고 있는 거네요.
최승준 그러니까 뭔가가 지금 있어요. 그리고 자기를 그리거나 하여튼 뭘 그리라고 했을 때 개연성 있는 이야기 구조와 그거에 어울리는 그래픽을 쓰거든요. 픽셀 아트가 됐든 3D가 됐든 아직은 fidelity가 좀 약할 수 있지만 그걸 지금 하고 있고, 서사 구조를 만들거나 그런 것들에서 지금 도약이 있다고 느꼈어요. 그런데 여기 이거는 두 줄짜리 프롬프트잖아요. 그래서 지금 모션 그래픽 비디오를 만들려고 한 거예요. 그래서 뭐가 나왔냐 하면 이게 타임라인에 많이 돌고 있거든요. 그러니까 예전 같으면 After Effects 같은 걸 써서 모션 그래픽 작업을 해야 하는 건데 이 안에 어떻게 했는지 들여다보니까 폰트를 TTF로 받고 그다음에 순전히 바닐라 JavaScript와 Web Audio만 가지고 텍스트 효과를 주고 장면 전환을 하더라고요. 그런데 이거는 이런 걸로 training이 되어 있지 않고서는 불가능하다고 저는 봅니다. 이걸 겨냥해서 training한 것 같아요. 이런 걸 할 수 있게 능력이 생긴 거죠.
검증 가능한 보상 없이 취향을 학습시키는 방법 30:46
박종현 궁금한 지점이 학습을 과연 어떻게 했을까 하는 생각이 들거든요.
최승준 너무 궁금하죠.
박종현 저희가 여태까지 RL이 잘 되는 이유가 verifiable reward가 있는 수학이라든가 정답을 줄 수 있는 그런 게 잘 되기 때문이라고 생각했는데 지금 오디오를 잘 합성하거나 아니면 이런 모션 그래픽을 잘 만드는 건 평가를 과연 어떻게 했길래 이게 가능할 것인가, 이런 게 좀 궁금하긴 합니다.
최승준 그걸 어떻게 확장했는지는 잘 모르겠어요. 이런 비슷한 논문이 작년에 Google에서 낸 게 있긴 해요. 그러니까 프론트엔드 디자인을 어떻게 hill climbing할 것이냐. 그런데 디자인이나 이런 것들이 코드로 만들어지는 게 기존에도 있기 때문에 저는 proxy, 그러니까 대리 지표가 분명히 뭔가 있어서 그걸로 hill climbing을 해서 취향 비슷한 걸 조금 얻어내고 있는 추세인 것 같아요. 그런데 그게 post-training만으로 될 건 아니고 pre-training도 같이 가야 되는 영역인 것 같긴 하거든요. 어쨌든 그걸 겨냥한 건 맞다는 게 제 추측이에요.
코드 policy로 로봇을 제어한 Astra 31:49
박종현 비슷한 예시로 로봇 활용에 Astra가 엄청 잘된다고 이번에 화제가 많이 됐었어요. 그러니까 로봇도 이미지처럼 action을 생성해야 되는데, 언어가 아닌 어떤 연속적인 값을 생성해야 되기 때문에 VLA라든가 이런 모델들을 많이 사용해서 만들고 있었거든요. 그런데 걔네들도 결국에는 다 diffusion이랑 비슷한 것들을 사용합니다. 왜냐하면 연속적인 값을 만들어야 되니까요.
그런데 이번에 Astra가 그렇게 하는 게 아니라 이거랑 똑같이 코드로 policy, 그러니까 로봇을 제어하는 코드를 짜서 돌려서 로봇을 제어하는 게 잘 됐다고 알려져 있는데 그게 왜 잘 됐을까 하면 사실 Gemini Robotics 2도 나온 지 얼마 안 된 모델입니다. 그런 모델들도 보면 Gemini의 pre-training 단계에서 로봇 관련 데이터를 이미 넣었다, 그래서 로보틱스도 잘된다, 이런 이야기들이 많이 있었거든요. 그래서 아마 GPT-6 Astra도 이번에 로봇 관련 데이터가 이제는 세상에 좀 나온 지 꽤 됐기 때문에 섞여 들어가서 multimodal 학습을 할 때 섞여 들어가서 잘되지 않을까 이렇게 생각했었는데
그런데 그것만으로는 어느 정도 수준 이상 가기는 좀 힘들었던 것 같아요. 로봇도 잘 제어할 가능성을 보여줬지만 실패 없이 잘하고 그렇지는 않거든요. 그런데 물론 그래도 엄청 놀라운 거긴 합니다.
최승준 말씀 듣고 보니까 규모를 키우는 건 어떻게 했는지 모르겠지만 전문가 궤적도 들어갔을 가능성은 높다고 봐요. 작업 궤적이요.
노정석 저도 아까 농담 삼아 그 말씀 드리려고 했는데 어떤 데이터셋 공급사가 이걸 잔뜩 공급했나 봐요.
최승준 그리고 그걸로 reward model 비슷한 걸 좀 만들고 그걸 계속 한 단계씩 올려 간다는 게 순진한 상상이긴 한데, 방법은 모르겠지만 하여튼 이게 hill climbing이 가능한 공간이구나 하는 느낌이 왔고요.
영역을 잇는 인간의 창의성과 모델의 궤적 33:47
노정석 그런데 저희 인간도 창의의 영역에서 봤을 때 저희가 어떤 한 곳의 전문가이면 그걸 가지고 하다가 다른 새로운 영역에 갑자기 그걸 적용해서 그 두 개를 이음으로써 새 영역을 창조하고 이런 경우들이 많잖아요. 그리고 그게 인류가 발전해 온 어떤 궤적이었고 모델한테도 똑같은 일이 일어나는 거 아닐까요? 얘에게 아트나 이런 걸 학습시켰는데 얘는 이미 코딩 천재였어요. 그 두 개 사이에서 어떤 것들이 의도하지 않았지만 일어났을 수도 있고, 저희는 알 수 없지만 이러한 기능을 안 가르쳤을 수도 있잖아요. 그런데 얘가 어떤 임계점을 넘어서서 그냥 본래부터 하게 된 경우도 있을 수 있으니까 만약에 그 경우라면 무서운 일이자 얘는 인간하고 똑같은 궤적을 따르는 거 아닌가라고 생각해야 되는 거죠. 저는 모델들 나올 때마다 항상 재미 삼아 이런 질문들을 해보거든요. 1 더하기 1의 답을 생각하는 동안 우주의 근원에 대한 모든 것을 생각해 보고 생각해 본 게 몇 가지나 되는지 얘기해 달라고 하면 이해하거든요. 이해한다고 얘기하고, 그사이에 다 갔다 왔다, 난 답을 알 것 같다, 이런 얘기를 하거든요. 그러니까 분명 사람처럼 뒤에서 딴생각하는 겁니다.
최승준 프롬프트를 그렇게 했기 때문에 하라고 해서 한 걸 가능성이 있긴 한데 어쨌든 그 행간을 알 수 없죠. 그런데 이번에 이 말씀들을 나누다가 드는 생각은 이번 수학 쪽의 돌파구 기타 등등을 탐색 공간의 문제로 봤을 때는 탐색 공간을 크게 크게 잘라 내려면 그 감각이 있어야 되잖아요. 어디는 안 가야 한다, 그 휴리스틱이 올라오고 있는 느낌이 전반적으로 느껴지거든요. 수학에서도 Ansatz를 생성하고 그걸로 갈 수 있는 공간과 못 가는 공간들을 이렇게 탁마(琢磨) 작업을 하는 것처럼 창작 쪽에서도 조합형으로도 하지만 취향이 있는 휴리스틱 같은 것들이 조금 올라오는 느낌을 받았고요. 이거는 다른 버전인데 ffmpeg 써서 이것도 15초에 맞춰서 자기가 만든 거예요. 그런데 이 정도에서 도구 호출한 걸 이렇게 보면 어떻게 했는지는 알아요. 그런데 cairo랑 numpy를 써서 ffmpeg로 하겠다고 해서 다양한 방식으로 하더라고요. 그런데 아까의 JavaScript 버전하고는 이건 또 다른 거예요. Python으로 한 거예요. 그래서 그런 게 지금 타임라인에 넘쳐나는 것들을 몇 개 더 가져왔던 거고요.
아티스트 정체성을 다시 쓰는 Kyle McDonald와 Zach Lieberman 36:38
최승준 그래서 이거에 대해 마무리 쪽으로 가면 제가 한국과도 인연이 있어서 여러 번 한국에 왔었던 미디어 아트 쪽의 고인물, 또는 크리에이티브 코딩 쪽의 고인물들이 어제오늘 한 트윗을 번역해 왔거든요. Kyle McDonald가 Opus 5.5를 써봤다. 15년 동안 내 소개란에는 코드로 작업하는 아티스트라고 적혀 있었다. 오늘 그냥 아티스트로 바꿨다고 썼고, 그런데 Zach Lieberman이라고, 이분도 유명한 분이거든요. 이분은 나는 어떤 면에서 오히려 정반대로 느끼는 것 같다. 아직 그 감정을 완전히 말로 표현하지 못하겠지만, 나에게 코딩 자체가 목적이었던 적은 없었다. 중요한 건 언제나 계산과 소프트웨어가 가능하게 해주는 여러 종류의 연결이었다. 그리고 지금은 그 점이 그 어느 때보다도 절실하게 느껴진다 라고 얘기를 했고요. 그다음에 거기에 댓글로 Alexander Chen이라고, 이분이 Google Creative Lab 쪽에 있어요. 그래서 이분도 흥미로운 작업을 Gemini가 흥했을 때 많이 올렸었는데, 돌이켜 보면 나는 평생 숫자와 패턴, 복잡계를 탐구하는 걸 그냥 좋아해 왔던 것 같다. 그리고 요즘은 그 탐구를 계속해 나가는 일이 그 어느 때보다 더 신나고 기대된다. 코딩을 안 하더라도.
그다음에 이분은 제가 이번에 처음 알았는데, 이 대화는 패널 토크나 강연, 혹은 편지를 주고받는 형식으로 이어져야 할 것 같다. AI를 둘러싸고 지금 벌어지는 일들을 보면서 코드·디지털 아티스트로서 우리가 느끼는 감정을 어떻게 말로 표현할 수 있을까? 나에게는 일종의 진자 운동 같다. 어떤 날은 Kyle의 생각에 완전히 공감하고, 어떤 날은 Zach의 입장에 더 가까워진다. 그리고 또 어떤 때는 그 둘 사이의 복잡한 중간 지대에 머물게 된다. 그래서 저도 요새 고민이 상당히 많이 생깁니다.
Terence Tao가 말한 속도를 늦출 이유 38:27
최승준 이걸 보고서는, 이건 좀 지난 얘기인데, Terence Tao의 9월 중순쯤 영상이 많이 퍼졌어요. 이게 밀레니엄 문제가 풀리고 며칠 뒤의 영상인데, 이제는 정말 천천히 가야 된다, 그런 얘기를 한 게 있거든요. 그래서 이거를 보고서는 어떤 분들은 좀 슬퍼하기도 하고 그랬던 얘기가 떠오릅니다. 수학이 이렇게 가속해야 할 어떤 것은 아니다. 속도를 늦춰야 된다. 속도가 미쳤다. 이렇게 갈 이성적인 이유가 아무것도 없다. 이때는 좀 흥분해서 아마 그 말씀을 하셨을 가능성이 있는데, 지금 Terence Tao 블로그에는 게스트 수학자들이나 철학자들이나, 하여튼 이 분야의 커뮤니티에 있는 분들이 공론장을 만들고 게스트 글들을 계속 올리는데, 저는 계속 추적하기가 좀 어려워도 수학의 내용은 이해하지 못하지만 그 톤을 알기 위해서 읽어보고 있는데, 생각해 볼 여지들이 많습니다.
무한한 인재 집단이라는 사고 실험 39:29
노정석 인간들 전체가 지금 러다이트 운동 중인 것 같아요. 생각해 보세요. 아인슈타인도 상대성 이론을 혼자 생각해 낸 건 아니거든요. 그 당시에 수많은 동료 과학자들과 서신을 주고받으며 그 생각의 토큰들과 피드백들을 계속 교환했거든요. 지금 에이전트들끼리 서로 소통하는 거랑 비슷한 작업들을 한 거고. 그런데 항상 르네상스 시절도 그랬고, 산업혁명 시절도 그랬고, 그다음에 물리와 화학이 중흥하던 1800년대 후반, 1900년대에도 그랬고, 특정 인재 집단들이 굉장히 크잖아요. 그런데 그 사람들이, 몇백 명, 몇천 명이 있었는데도 그런 것들을 했는데, 여기에 그 사람들이 무한히 있다고 생각해 보면 어떤 일이 일어날까? 지금 그 상황이 닥친 거잖아요. 모든 영역에 그걸 잘하는 무한한 수의 사람들이 지금 들어가 있는 건데, 이러한 가정을 놓고 사고 실험을 해보면 많은 것들이 달라져야 되지 않을까요?
최승준 하여튼 우려스럽긴 한데, 이거에 관심을 끈 분이 또 이번 주에 있었어요. DHH라는 분이거든요. Ruby on Rails를 만든 분인데, 관심을 끄는 강력한 말을 해가지고, 나는 이제 더 이상 코딩 안 하고 너희들도 그래야 된다는 뉘앙스로 얘기를 해서 타임라인에서 제 관심을 잔뜩 끌었습니다.
코더에서 메이커로: 코딩을 멈춘 DHH 40:38
최승준 그런데 그거에 대해서 Pi라는 에이전트를 만드는 Mario Zechner 등은 좀 신중한 편이잖아요. Mario Zechner가 최근에 DHH의 말을 인용하면서 포스팅했던 게 있었거든요. 그래서 결국 Mario Zechner 등이 하는 얘기는 여전히 코드에 대한 이해를 하고 있는 건 중요한 것 같다. 그래야 이거를 잘 통제해 가면서 하지, 완전히 그냥 다 맡기면 그걸 감당하기 어렵다는 얘기를 이쪽 계열은 계속하고 있긴 해요.
그런데 저는 둘 다 진실이 있다고 보거든요.
노정석 그런데 그거는 우리 그런 얘기들 있잖아요. 누구는 책을 수십 년 읽고 깨달음을 얻고, 누구는 좋은 선생님을 만나서 얻고, 누구는 술만 마시다가 얻고, 누구는 문고리만 잡고도 깨달음을 얻는다고 하잖아요. 그래서 그 깨달음의 단계에 도달하는 방법은 굉장히 다른데, 저희는 여전히 지금 저희가 익숙한 것들을 가지고 세상을 바라보거든요. 그러니까 코딩을 예로 들면, 코딩 안에 Python function이 어떻고 class가 어떻고 for loop나 이런 것들이 어떻게 도는지 알고, 대략적인 엔지니어링 블록들이 어떻게 돌아가는지를 알아야 이게 제대로 됐는지 알 수 있다고 생각하죠. 전통적인 방법이거든요. 그런데 이 모델이 내주는 산출물들의 품질이 올라가고 그것들을 시도하는 데 드는 가격이 내려가는데, 그럼 우리의 다음 세대가 어떠한 결과물을 내는 소위 라이트 엔지니어링을 하는 데 있어서 코드를 알아야 될까? 아닐 수도 있거든요. 그냥 수많은 시행착오를 해보고, “이렇게 하면 이렇게 돼”라고 하면서 그 결과물을 내는 단계에 완전히 다른 방식으로 도달할 수도 있는 거여서.
최승준 그렇죠.
노정석 저는 솔직히 지금 단계에서는 코딩 안 하는 게 낫다. 차라리 “해줘, 해줘, 해줘” 해서 그 새로운 로직을 체화하는 게 낫다는 생각은 좀 들고 있습니다.
최승준 그래서 DHH가 관심을 끌 때 결국엔 우리가 코더가 아니라 메이커가 된다는 거를 슬라이드로 띄운 게 있어요. 훌륭한 메이커가 된다. 그런데 제가 이번에 파이라는 토스에서 만든 디자인 학교에서의 4주 정도 수업을 마무리했을 때 느낀 거는 학생들이 흥미로운 산출물들을 내긴 했거든요. 그런데 그걸 했을 때 상방을 열어주는 게 중요했어요. 뭐냐 하면 현재 AI로 어디까지 가능한지 조사하자. 그게 아닌 상태에서는 늘 쓰던 정도에서 쓰는데, Astra가 나왔을 때 뭐가 가능해졌나 그런 것들을 조사하고 스스로 실험을 해보고 했을 때 뭐가 가능한지를 알면 모방이나 응용이 생기는데, 뭐가 가능한지 자체를 모르면 아무리 옆에 최고 성능 모델, 현재 최고 성능 모델을 쓰고 있더라도 그걸 추진하지 못해요.
상방을 열어주는 교육과 용어를 몰라서 생기는 공백 43:19
최승준 그리고 두 번째로 중요했던 거는 가끔은 브레이크를 너무 일찍 잡지 말아야 된다. 그 메시지를 전달하려고 했었거든요. 몰입해가지고 밀어붙이는 작업을 해야만 넘는 구간들이 여전히 있긴 하다. 그냥 “해줘”로만은 안 된다.
그런데 또 받게 되는 피드백이 그런 개념들을 몰라서 못 쓰는 경우들이 있어요. 그러니까 뭐가 가능한지를 몰라서 못 쓰지만, 아까 같은 오디오 합성이 돼. 그거에 대한 기초 개념, 또는 개념은 아니더라도 용어 자체를 몰라서 못 쓰는. 그러니까 Three.js를 몰라서 못 쓰는 이런 일들이 있어요. MediaPipe를 몰라서 못 쓰는.
그래서 그런 것들을 자기가 만약에 어떤 분야의 전문가라고 하면 그런 개념어들을 다 꿰고 있고, 그다음에 누가 주요한 창작자인지를 알고 있고, 역사도 알고 있어서 그런 것들을 인출해서 쓸 수 있는데, 초보자들의 경우에는 그 과정이 생략되는 게 좀 걱정스럽긴 하다는 거죠. 왜냐하면 어떤 부분은 그냥 “해줘, 해줘”로 도달하지 못한다는 걸 이번에 좀 관측했어요.
노정석 그런데 또 그 영역에서 내가 뭘 해보겠다고 정말 마음을 먹고 시행착오를 반복하면서 머릿속에 무언가 데이터가 많이 쌓이면
최승준 그때는 가능한 거죠. 그러니까 거기에 들여야 되는 시간과 노력은 여전히 있다고 느껴지긴 하지만, 지렛대가 잘 작동한다. 그래서 결국 멋진 걸 만들고서는 그 느낌을 받죠. 사람들이요. 내가 한 것 같지 않다.
생산성 격차를 만드는 태도와 시간 45:22
노정석 그런데 승준님이 방금 말씀하신 내용이 그게 꼭 아트나 이런 데뿐 아니라 회사나 비즈니스에서도 아마 똑같이 적용될 겁니다. 지금 AI가 이렇게 극적으로 일들을 해주는데도 불구하고 왜 회사들의 생산성은 올라가지 않을까라는 그런 질문들도 많이 하잖아요. 그래서 그런 것들을 보고 강하게 받아들여서 뭔가를 하는 사람들이 많이 모인 데는 변화가 쭉쭉 일어나고, 그러지 않기로 결정한 사람들이 모인 곳에서는 뭘 보여줘도 안 되고. 그러니까 이거는 AI의 문제가 아닌 거죠. 그걸 쓰는 사람들의 문제인 거죠.
최승준 그래서 지금 태도의 문제들이 있어요.
박종현 저는 시간의 문제라고 생각하긴 하거든요. 그러니까 AI를 이것저것 많이 써봐서 무언가 많이 된다는 걸 먼저 알아챈 사람들은 앞으로 나아가고 있고, 아닌 사람들도 제가 주변을 한 1, 2년 이렇게 관찰해 보면 결국에는 다 AI를 많이 쓰는 방향으로 점점 넘어오고 있는 것 같아요. 그래서 결국 시대의 변화는 시간에 따라 사람들에게 다르게 다가올 뿐, 결국 오지 않나 이렇게 생각을 하고, 거기서 뻗어 나가서 어떤 것들이 고민이 되냐면 뭘 만들어야 될까, 이런 생각을 하게 되거든요. 결국엔 무언가 다 만들 수 있다, 이렇게 가정하고, 지금 승준님께서 보여주신 것도 결국에는 다 창작이라고 얘기해 주셨는데, 안 되던 것들이 이런 방식으로 잘 된다. 그래서 이걸 가지고 우리가 뭘 만들어야 될까, 이런 고민으로 뻗어 나가게 되는데,
무엇이든 만들 수 있을 때 무엇을 만들 것인가 46:35
박종현 극단적으로 얘기하면 지금 저희가 이렇게 대화하고 있는 거를 녹화하고 이게 YouTube에 게시되잖아요. 이것도 콘텐츠를 만들어서 내보내는 건데, 예를 들면 이것도 시간이 지나면 다 만들 수 있겠죠. 저도 이게 궁금해요. 이걸 보시는 분들은 만약에 지금 이 촬영과 만들어지는 걸 AI가 다 만들었다고 하면 보실까요? 내용 때문에 보시는 거면 AI가 만들었든 아니든 보겠죠. 그런데 그게 아니라 실물 사람, 저희라는 사람의 말을 듣고 싶은 거면 아마도 저희 걸 찾아보실 텐데, 그게 아니라 내용만이 가치를 가진 거라면 저희가 굳이 나와서 얘기하지 않아도 그 가치를 잘 전달할 수만 있으면 그걸 찾아볼 거잖아요. 그래서 미래에는 이런 생성으로 엄청나게 많은 양질의 콘텐츠가 만들어지게 될 텐데, 미술이든 음악이든 정보든 영상이든 뭐든지 간에 사람들은 뭘 왜 보게 될까, 그럼 뭘 만들어야 될까? 이런 데 있어서 고민을 요즘 많이 하게 되는 것 같아요.
스포츠의 시대와 호모 루덴스 48:02
노정석 저희 선배님 중에 한 분이 그 얘기를 하신 적 있어요. 스포츠의 시대가 온다고 말씀하시는 분이 계시거든요. 예를 들어 100m 달리기를 차 타고 하면 당연히 빠르지라고 하는데, 인간끼리 100m라는 경기를 만들어 놓고 그 안에서 경쟁하고 휴먼 드라마를 만들면 열광하잖아요. 그런 것처럼 지적인 부분이나 이런 것들도 다 기계가 해 줄 거니까 인간은 인간들끼리의 경쟁과 스토리와 감동을 즐기는, 그야말로 호모 루덴스의 시대로 들어가는 거니 복잡하게 모델이나 이런 걸 고민하지 말고 이미 당연한 미래를 받아들여라, 받아들이고 미리 스포츠와 엔터테인먼트의 세상으로 가자고 말씀하신 분이 계셔서 저도 그것도 상당히 의미 있는 일이라는 생각이 들었던 적이 있습니다.
최승준 저도 어젯밤에 관련 있을 수 있는 고민을 했던 것 같은데, 어쩌다 보니까 유튜브에서 프로 피아니스트들이 몰래카메라를 하는 영상을 몇 개 봤어요. 그런데 프로 피아니스트들은 아까 음악에 대해 실험한 것과는 매우 달랐거든요. 제가 음악을 잘 알지 못하지만 인간의 정념 같은 게 느껴지는 건 여전히 상당히 매력적이다. 선율을 그대로 연주하는 게 아니잖아요. 나름의 해석과 의도를 담고. 그런데 그런 것들이 아직은 모델에선 좀 재미가 없어요.
시뮬레이션된 정념에도 감동할 것인가 49:09
최승준 하지만 기초 문법들은 획득하고 있다. 그래서 이게 얼마나 남은 건지는 모르겠으나 인간이 맑눈광이 되고 미쳐서 뭔가를 해내고 도전하는 그런 서사까지도 딸깍이 될 것이냐. 우리가 그 유튜브 영상을 봤다는 것 자체가 그냥 영상으로만 본 거잖아요. 그런데 분간 못 할 정도의 영상을 봤을 때 나도 똑같이 그런 시뮬레이션된 정념의 감동을 받을 것이냐. 이거는 그때가 와 봐야 알 수 있는 거죠.
노정석 지금은 정말 아무도 모르는 것 같아요. 그래서 굉장히 다양한 관점의 예측이 있는 것 같고, 그래도 확실한 게 있다면 ‘AI는 이런 거 못 해’라고 하는 데서 ‘AI는 모든 걸 다 할 수 있어’로 오는 데 얼마나 짧은 시간이 걸렸습니까?
최승준 영역에 따라 다르긴 하지만 되는 영역들은 정말 어마어마했어요.
노정석 ‘이건 안 될 거야, 안 될 거야’라고 한 거 지금 다 해내고 있잖아요. 창의성까지 와서 이걸 보는 것 자체도 참 웃기고.
창의성에서 생명공학으로: Anthropic의 wet lab 50:38
최승준 그래서 그런 관점에서 이번 주에 Anthropic이 조금 비판받고 있는 게 CRISPR 가위 비슷한 걸 찾아냈다, Anthropic이 wet lab을 해 가지고 지금 또 이슈가 되고 있잖아요. 그런데 거기서도 지금 이거는 별거 아닌 것 같다는 전문가들의 반응이 있는데, 그래도 마음에 새겨야 될 건 신호가 있다는 것 자체가 항상 문제다.
노정석 아까 승준님이 2022년 그거 보여주신 구글에서 아마 2년 내에 이게 정복될 거라고 했는데 저희는 4년 걸렸다고 말씀 주셨었는데, 생명공학계에서 반발이 있어요. 저거 우리 이미 하던 거고 뻔한 거 가지고 나와서 왜 호들갑이냐고 얘기하는데, 이제 시작인 거죠.
최승준 예, 신호가 있다는 것 자체가 문제적이다. 거기에 돈이 쓰이고 있다는 거고.
프론티어 랩에서 프론티어 컴퍼니로 51:25
노정석 그런데 OpenAI나 Anthropic 같은 회사들이 처음에는 단순한 모델 플레이어로 시작했는데 이 모델에서 옆으로 횡적 확장을 할 수 있었던, tool call을 좀 더 잘하고 memory 기능을 하고 안에 몇 가지 Word나 PowerPoint 같은 기능들을 내재하고 이런 것까지는 이해할 수 있었는데, 그 횡적 확장을 다 끝낸 이후에는 종적 확장까지 하고 있다는 게 법무, 재무, 또 생명공학, 과학 이런 것까지 자기네들이 다 하고 있잖아요.
최승준 무소불위의 권력을 가질 가능성을 사람들이 걱정하는 거죠.
노정석 프론티어 랩이라고 부르지 말자, 프론티어 컴퍼니라고 부르자고 이렇게 얘기하고 있는데, OpenAI나 Anthropic이 그런 식으로 영역 확장을 위로 옆으로 다 해 가면 뭐가 남을 것인가? 또 Anthropic 회사 안에서는 그런 식의 자조 섞인 이야기도 있다고 해요. 우리가 모든 걸 다 하게 될 거다. 우리가 인류를 책임져야 한다는.
최승준 사명이 Anthropic인데요. 그렇죠. 골치 아픕니다.
Tech Week을 앞둔 샌프란시스코 현장 52:33
노정석 자, 그리고 말이 나온 김에 종현님이 지금 미국에 가셨거든요. 자연스럽게 미국 간 얘기 좀 해주시죠.
박종현 제가 어제 딱 미국에 왔는데,
노정석 샌프란시스코죠, 정확히. 저희 입장에서 미국 하면 거의 대부분 실리콘밸리를 얘기해서. 실리콘밸리에 가셨죠?
박종현 한국인 창업자들이라면 아마 다 알 만한 EO House에 잠시 의탁하러 와 있고요. EO 채널, 스타트업 관련 콘텐츠를 발행하는 채널에서 운영하는 해커하우스고, 제가 여기 온 거는 다음 주에 있을 Tech Week에 참가해서 여기저기 행사들을 많이 돌아다니려고 왔습니다.
그래서 제 계정이나 이런 거 팔로우하시는 분들은 제가 영상 관련 스타트업을 막 시작했다는 걸 알고 계실 텐데요. 관련해서 제가 오늘 이야기한 영상 생성이나 관련된 작업들에 대해 프론티어에서는 어떤 식으로 접근하고 있는지 최대한 따라가 볼 예정이고, 아마 이 영상 보시는 분들 중에 행사 참석하시는 분들 꽤 계실 것 같아요. 여기는 하나의 큰 행사가 아니라 수백 개의 행사들이 시내 여기저기서 열리는 거라 각자 알아서 관심 분야에 참여하는 행사거든요.
그래서 관심 있으신 분들은 제가 이 행사 끝나고도 일주일 정도 더, 오늘부터 한 달 정도 샌프란시스코에서 지낼 예정이니까 저한테 커피챗 하고 싶으신 분들 혹시 있으시다면 편하게 연락 주시면 같이 만나서 이야기하면 좋을 것 같습니다.
노정석 저도 EO House가 팔로알토에 있을 때 거기 가서 한참 지냈었던 적이 있는데, 안부 전해주시고 또 EO House에 계신 분들도 모두 좋은 사업 만드시길 기원드립니다.
최승준 저희가 이게 발행될 때쯤이면 DevDay가 이미 진행 중이겠죠. 29일부터. 뭐가 나올지는 모르겠습니다만, 뭐가 나오겠죠.
DevDay와 전천후 비서 에이전트에 대한 기대 54:25
노정석 에이전트 나온다고 그래요? 네, Muse 에이전트 같은 굉장히 쓸 만한, 진짜 전천후 비서 형태로 돼서. 이게 사실은 소비자용 애플리케이션의 거의 궁극 아니겠어요? 거의 모든 것들의 게이트웨이 위치를 노리는 건데, 이게 됐을 때 또 이 소비자 산업이 어떻게 바뀔지. 사람들이 검색하러 안 가고 물건 사러 안 가고 글을 읽으러 가지 않고 다 비서한테 ‘해 줘, 해 줘, 가져와, 가져와, 사 와, 사 와’ 이렇게 되면 또 이 산업계가 어떻게 바뀔지. 이런 것들이 모두의 관심사입니다.
최승준 그런데 그거 하나가 아니라 Tibo 포스팅 봤을 때는 ship이, 배가 한 다섯 개쯤 있었거든요. 뭐가 나올지는 모르겠습니다만 또 도파민 시기가 너무 자주 오는 것 같아요. 9월만 지금 몇 개예요? 9월 초에 Fable, Astra, 그다음에 GPT-6 Sol. 하여튼 9월 한 달에 이렇게 많았던 때가 있기도 했었지만 참 재미있으면서도 어렵습니다. 견뎌야 되는 것 같아요.
Tesla의 10월 1일 발표와 거리의 자율주행차 55:25
박종현 저는 사실 기대하는 거 하나 더 있긴 합니다. 잠깐 얘기했었는데, 10월 1일에 Tesla에서 발표한다는 무언가. 무언가일지는 잘 모르겠지만 Roadster 말고 무언가가 있는 것 같아요.
최승준 예, 날아가는 뭔가일 수 있다, 그런 소문이 있다면서요?
박종현 제가 샌프란시스코 와서, 정말 오랜만에 오는데, 아마 여기 왔다 갔다 해보신 분들은 다 보셨겠지만 Waymo나 Zoox라고 해 가지고 여기는 진짜 사람이 없는 차들이 너무 당연하게 다 다니고 있잖아요. 이런 것들이 조금 이질적으로 느껴지는데, 그 선상에 있는 무언가일 것 같아요. 실제로 우리 세상에 들어오는 AI 기반의 무언가.
최승준 그러면 다음이 금방 오겠네요.
관점 형성이 따라가지 못하는 변화 속도 56:08
노정석 다음 주에는 또 새로운 소식을 가지고 오는데, 소식보다 그 소식에 대해서 어떠한 관점을 형성해 놨느냐가 좀 중요한 시기가 되어 가는 것 같고, 그 관점들이 아직 다 형성되지 않았다는 생각은 들어요. 지금 너무 바뀌어 가지고.
최승준 관점이 형성되기 전에 뭐가 계속 나오기 때문에 관점을 형성하기가 어려워요.
노정석 그러니까 그런 것들을 모두 초월하는 어떠한 관점, 다음 레이어의 시작이라고 저는 생각하는데, 다음 레이어에 다른 차원에서의 도약이 필요한 그런 시기인 것 같습니다.
최승준 어렵습니다. 저희도 그 관점이라는 게 hill climbing 정도지, 완전히 점프해서 생각하는 게 되나요? 잘 모르겠어요.
노정석 그 점프를 하는 사람들이 지금 종현님이 간 실리콘밸리에 몇 명 있잖아요. 사실 그 사람들이 세상에 대해서 어떤 action을 취하면 저희는 거기에 반응하면서 관점을 잡아갈 수밖에 없는, 지금은 다소 수동적인 시기이긴 하죠. 그렇게 해서 세상이 확 바뀌어 버리면 그 사람들이 큰 몫은 차지할 테고, 그러면 저희는 또 작은 틈새에 가서 무언가 우리만 할 수 있는 것들을 찾는 거죠. 항상 그래 왔으니까.
그런데 이번에는 사실 너무 impact가 크고, 그다음에 기존에는 도구를 만드는 게 기술의 혁신이었는데 이제는 도구를 만드는 도구, 그건 지능이 만들어진 거니까 이거는 너무 다른 거잖아요. 그래서 모두가 다 다르게 바뀌고 있는 것 같고, 너무 근본적인 변화이다 보니까 역사에서 빌려올 만한 틀들이 많이 없는 것 같아요.
테트리스가 보여주는 epistemic action 57:45
최승준 제가 이번에 모델들하고 대화하다가 epistemic action이라는 용어가 나왔는데, 그게 뭐냐 하면 테트리스 같은 거 플레이할 때 돌려봐야 맞출 수 있다는 거예요. 그래서 어떤 예측을 하려면 행위를 해야지, 여기가 어디에 맞아떨어지는지 알려면 인식론적인 행위들을 해야 된다는 건데, 큰 틀에서는 모르겠지만 저희 같은 작은 틀에서 할 때는 자꾸 뭔가를 해봐야 되는 건 맞는 것 같아요.
노정석 맞아요. 그리고 그걸 해 본 사람과 안 해 본 사람이 지금 물과 기름처럼 갈려 있긴 하거든요.
최승준 해봐야겠습니다.
노정석 저희는 또 해봐야죠. 저도 일주일 출장 갔다 왔더니 일주일만 여기를 챙기지 않아도 세상이 휙 가서 머리가 좀 detach되는 그런 경험을 했습니다.
다음 변화를 기다리며··· 58:29
최승준 그러면 저희는 다음 시간에
노정석 다음 시간에 또 뵙겠습니다. 시차 적응 잘하시고요.
최승준 또 재미있는 소식 기대하겠습니다.
박종현 제가 최대한 재밌는 소식 특파원처럼 잘 물어 오도록 하겠습니다.
최승준 감사합니다.