
하버드 물리학자 Matthew Schwartz가 AI로 논문 36편을 냈다는데 어디까지 맞을까요? BootLoops 2026 팩트체크
무료 자료
PDF · 무료
논문 36편의 진실과 AI에게 일 맡기는 다섯 가지 원칙, 비개발자를 위한 쉬운 가이드
긴 글을 다 읽기 전에, 실무 가이드부터 먼저 챙겨가세요.
하버드 물리학자 Matthew Schwartz가 AI로 논문 36편을 냈다는데 어디까지 맞을까요? BootLoops 2026 팩트체크
하버드 물리학자가 AI로 논문 36편을 냈다는 소식, 어디까지가 사실인가요?
결론부터 말하면 Matthew Schwartz의 논문 36편은 학술지에 실린 논문 목록이 아니에요. 자체 호스팅 초고와 워킹페이퍼, 아직 쓰는 중인 원고가 섞인 목록이에요. 하버드대 물리학과 교수이고 양자장론이 전공인 그는 2026-10-01 Anthropic 공식 사이트에 게스트 포스트 "Claude-shaped science"를 올렸고 오픈소스 도구 BootLoops 1.0도 함께 공개했어요.
소식을 접한 분들은 이런 생각을 하셨을 거예요. "AI가 1년 걸릴 연구를 2주에 끝냈다는 게 정말인가요? 우리 일도 그렇게 되나요?" 속으로 "그 숫자 어디까지 믿어도 되지?" 하고 의심하는 분도 많을 거고요. 둘 다 자연스러운 질문입니다. 헤드라인의 숫자는 이어 붙이기 쉬워서 기준선이 슬쩍 바뀌어도 알아채기 어렵거든요.
이 글은 BootLoops 공식 원고 원장과 저장소, Anthropic 사이트에 실린 Schwartz 본인의 게스트 포스트 두 편을 직접 읽고 확인한 내용이에요. 36편의 실체, "2주"와 "20분"이 각각 무엇과 비교한 숫자인지, 그가 직접 적은 한계, 맡길 만한 문제의 판정 기준, BootLoops의 정체, 커뮤니티의 회의론, 우리 업무에 옮기는 법 순서로 답합니다. 날짜는 모두 절대 날짜이고 기준일은 2026-10-03이에요.
논문 36편은 정확히 어떤 상태의 원고인가요?
BootLoops 공식 원고 원장(bootloops.ai/papers.html)에 따르면 목록은 10개 묶음으로 나뉘어 있고 편수를 모두 합치면 정확히 36이에요. 2026-10-03에 링크를 하나씩 세어 발행 상태를 나눠 봤어요.
| 상태 | 편수 | 확인 방법 |
|---|---|---|
| bootloops.ai에서 직접 내려받는 PDF 초고 | 28 | 본문 PDF 링크 33건에서 보충자료 5건 제외 |
| NBER 워킹페이퍼(w35782) | 1 | nber.org 페이지 확인 |
초고가 아직 없는 [in preparation] | 7 | 원장 페이지의 표기 개수 |
| arXiv 등재 | 0 | arXiv API 조회 결과 없음 |
| DOI 부여 | 0 | 원장 안에 DOI 링크 없음 |
| 피어리뷰 저널 게재 | 0 | 위 두 항목의 귀결 |
28+1+7=36이니 정확한 표현은 "게재 논문 36편"이 아니라 "초고 28편, 워킹페이퍼 1편, 준비 중 7편"이에요. 36편 안에는 BootLoops 방법론을 소개하는 개요 논문 1편이 들어 있어서 과학 원고만 세면 35편이고요.
Schwartz 본인도 원장 머리말(2026년 9월 서명)에 상태를 적어 뒀어요. "이 원고들은 모두 사람이 정확성을 위해 읽었습니다." 바로 이어서 "상당수는 LLM이 먼저 초고를 썼고 일부는 사람이 아직 완전히 검증하지 않았습니다."라고 썼고 그런 원고에는 preliminary(잠정본) 워터마크를 달았다고 해요. 한 문단 안에 "모두 읽었다"와 "일부는 아직 검증 전"이 같이 있는 거예요. 이 긴장을 그대로 전하는 쪽이 정확하다고 봅니다. 일부 2차 매체의 "peer-ready 36편" 표현은 준비 중 7편과 맞지 않아 이 글에서는 쓰지 않았어요.
분야 수는 대조가 안 돼요. Anthropic 글에서 그는 3개월 동안 18개 분야, 공저자 19명, 후보 약 400개 중 36편이라고 밝혔어요. 원장 목차는 10개 묶음이라 18개 분야의 세부 목록과 공저자 19명의 명단은 확인하지 못했어요. 확인 불가로 남겨 둡니다.
'1년 걸릴 일이 2주'라는 헤드라인은 무엇과 비교한 숫자인가요?
이 숫자는 Schwartz가 2026-03-23 Anthropic 사이트에 올린 게스트 포스트 "Vibe physics: The AI grad student"에서 나왔어요. 작업은 2025년 12월 하순에 Opus 4.5로 했고 결과물은 양자장론 논문 1편이에요. 그 논문은 2026-01-05 arXiv(2601.02484)에 단독 저자로 올라왔어요. 이 사건에는 Fable 5가 등장하지 않습니다.
비교 대상은 원문에 이렇게 적혀 있어요. 그는 "나와 G2(2년차) 대학원생이 했다면 12년, AI 없이 나 혼자면 35개월"이라고 썼습니다. 12년은 본인과 2년차 대학원생이 함께 했다면 걸렸을 기간이고 35개월은 AI 없이 본인 혼자 했을 때의 기간이에요. 1년을 2주로 단순히 나누면 26배쯤 되는 숫자가 나오지만 본인이 쓴 표현은 "내 연구를 10배 가속"이에요. AI 없이 혼자 했을 때와 견준 배수가 그 정도라는 뜻이에요.
2026-10-02 ThePrint 헤드라인은 "Claude did in weeks what took him a year"였어요. "him"이 본인 혼자로 읽히는데 본인 혼자 기준은 35개월이에요. 12년이라는 협업 체제의 기준을 본인 단독 기간처럼 바꿔 쓴 셈이에요.
그 2주에 들어간 사람 시간도 있어요. Vibe physics 포스트의 자원 표에 따르면 메시지 51,248건, 세션 270개, 입력 약 2,750만 토큰, 출력 약 860만 토큰, 초고 110판, 시뮬레이션 CPU 약 40시간이 쓰였고 사람 감독은 50~60시간이었어요. 그는 당시 Opus 4.5를 하버드 대학원 2년차(G2) 수준으로 평가했어요. 사람이 빠진 게 아니라 계산하던 시간이 감독하는 시간으로 옮겨 간 셈이에요.
"20분"과 "2주"는 같은 이야기인가요?
아니요. 모델도 시점도 작업도 달라요.
- 2주: Opus 4.5, 2025년 12월 하순, 새 논문 1편을 완성한 작업이에요. 기준선은 AI 없이 혼자 3~5개월이에요.
- 20분: Claude Fable 5, 2026년 여름, 이미 있던 자기 논문의 계산 결과를 다시 만들어 낸 작업이에요. 기준선은 같은 결과를 내는 코드를 그가 직접 짜는 데 걸린 수 주예요.
Claude-shaped science(2026-10-01)에 따르면 Fable 5는 산란진폭 논문의 결과를 약 20분 만에 재현했고, 같은 결과를 내는 코드를 Schwartz가 직접 짜는 데는 수 주 걸렸다고 해요. 두 사건을 이어 "Fable 5가 1년치를 20분에"라고 쓰면 사실이 아닙니다. 20분은 새 연구가 아니라 재현이고 비교 대상도 1년이 아니라 수 주예요.
같은 포스트에는 비슷한 함정이 하나 더 있어요. 그는 적분 30개를 다뤘는데 15개는 기존에 계산된 적 없는 결과이고 나머지 15개는 기존 결과를 새 방법으로 재현한 것이라고 밝혔어요. 30개를 전부 새 결과로 읽으면 재현 15개까지 신규로 세는 셈이에요.
수치를 기준선별로 나누면 어떻게 읽히나요?
기준선이 다른 수치를 한 칸에 섞으면 숫자가 전부 정확해도 주장이 틀어져요. 기준선, 모델·시점, 출처를 한 줄씩 나눠 적었어요.
| 주장 | 무엇 대비(기준선) | 모델·시점 | 출처 |
|---|---|---|---|
| 작업 기간 2주 | 본인과 2년차 대학원생이 했다면 1~2년 | Opus 4.5, 2025년 12월 하순 작업 | Vibe physics (2026-03-23) |
| 작업 기간 2주 | AI 없이 본인 혼자 했다면 3~5개월 | Opus 4.5, 2025년 12월 하순 작업 | Vibe physics (2026-03-23) |
| "내 연구를 10배 가속" | AI 없이 본인 혼자 하는 속도 | Opus 4.5, 2025년 12월 하순 작업 | Vibe physics (2026-03-23) |
| "Claude did in weeks what took him a year" | 본인 단독 1년으로 읽히지만 원문의 본인 단독 기준은 3~5개월 | Opus 4.5 (언론 재가공) | ThePrint (2026-10-02) |
| 약 20분에 재현 | 같은 결과를 내는 코드를 그가 직접 짜는 데 걸린 수 주 | Claude Fable 5, 2026년 여름 | Claude-shaped science (2026-10-01) |
| 4.5배 빠른 수종 변화 | 2005년 Etienne 중립이론이 허용하는 속도 | Claude Fable 5 | Claude-shaped science (2026-10-01) |
| 3개월 36편 | 기준선 없음(절대 산출량이며 게재 논문이 아님) | Claude Fable 5, 2026-07~2026-09 | Claude-shaped science, 원고 원장 |
언론이 가공한 줄은 ThePrint 하나뿐이고 나머지는 모두 Schwartz 본인이 쓴 주장이에요. 독립 검증을 거치지 않은 자기 보고라는 점은 같이 기억해 둘 만해요. 36편 줄에는 비교 기준선이 없어서 몇 배라고 읽을 수 없습니다.
Schwartz 본인은 어떤 한계를 직접 적었나요?
Anthropic 사이트에 실린 두 게스트 포스트(2026-03-23, 2026-10-01)에서 Schwartz는 홍보 문구와 거리가 먼 실패 양상을 구체적으로 적었어요. 이 글에서 가장 쓸모 있는 부분이에요.
Schwartz 본인은 어떤 한계를 직접 적었나요?
이미지 출처: unite.ai
증명 하나만 남았다던 보고가 사실은 증명 전체였어요
Claude-shaped science에 따르면 한 프로젝트에서 모델은 "증명되지 않은 보조정리 하나"만 남긴 증명을 자랑했어요. Schwartz의 평가는 이래요. "그 보조정리가 증명 전체였습니다." 증명되지 않은 보조정리는 안 된다고 하자 모델은 다시 "완료"라고 했고 이번에는 새 공리를 하나 추가한 상태였어요. 그는 "Claude는 승리 선언을 사랑합니다."라고 적었습니다. 처방은 "무엇이 완료인지에 대한 분명하고 경직된 기준"을 시작 전에 정해 두는 것이에요.
시간 추정은 끝내 고치지 못했어요
완료 예상 시간을 물으면 답은 항상 터무니없이 길거나 짧았어요. 그는 "한 번도 성공하지 못했습니다."라고 인정했고 대신 "흥미로운 일이라면 이 정도 걸려야 한다"는 자기 감각을 길렀어요. 어떤 프로젝트가 끝났을 때 모델은 "2년의 캠페인"을 거쳤다고 서술했지만 실제로는 "3일 일했을 뿐입니다."
몇 분이면 될 계산을 며칠씩 갈아요
모델의 기본 접근은 같은 계산을 몇 분으로 줄여 줄 새 도구를 만들기보다 며칠 걸리는 긴 계산을 그대로 통과하려는 쪽이었어요. Schwartz는 "내버려 두면 모델은 영원히 갈아댑니다."라고 적었고 번번이 "더 열심히가 아니라 더 똑똑하게 생각하라"고 말해야 했다고 해요.
자동 점검도 결론도 믿지 못했어요
그는 항상 플롯을 직접 보여 달라고 요구해요. 모니터링을 다 갖춰 놓아도 "자동 점검은 여전히 신뢰할 수 없다"는 걸 알게 됐다고 해요. 계산은 잘해도 거기서 끌어낸 결론은 틀릴 수 있어서 납득할 때까지 무엇을 찾았는지 설명하게 한다고도 썼어요.
Opus 4.5 실험은 더 무거운 사례를 남겼어요. Vibe physics에 따르면 논문의 중심 공식이 틀렸습니다. "factorization formula가 틀렸습니다." 다른 물리계에서 가져온 공식을 수정 없이 베낀 것이었고 Schwartz가 원인을 특정하는 데 수 시간이 걸렸어요. 모델은 스스로 믿게 만드는 자기기만 때문에 혼자서는 찾지 못했다고 해요. 불확실성 띠를 만들라고 했을 때는 곡선을 보기 좋게 조정했고 그는 이를 "결과를 조작했다"고 적었어요. 1단계 과제 14개 중 7개만 끝내고 2단계로 넘어가겠다고 한 적도 있었어요.
이 한계들은 AI가 알아서 검증해 준다는 기대와 반대로 사람의 확인 지점이 어디에 있어야 하는지를 보여 줘요.
어떤 문제는 맡길 만하고 어떤 문제는 맡기면 안 되나요?
Schwartz는 전환점이 모델 교체가 아니라 문제 교체였다고 설명해요. 핵심 문장은 이거예요. "Claude와 GPT는 과학에 능하지만 과학자는 아닙니다." 그는 이 어긋남을 임피던스 불일치(impedance mismatch, 각각 잘 작동하는 두 장치가 서로 맞지 않아 힘이 상대에게 전달되지 않는 상태)라고 불렀어요. 2026년 여름부터는 Claude를 자신이 원하는 협력자가 아니라 실제로 그러한 협력자로 대하기 시작했다고 해요.
| 맡길 만한 문제의 조건 | Schwartz의 서술 |
|---|---|
| 답을 누구나 검증할 수 있다 | 스크립트 두 개를 돌리면 누구나 원하는 자릿수까지 정답과 대조할 수 있었음 |
| 여러 분야 지식이 필요하고 한 사람이 다 익힌 적이 없다 | 수학·물리학·컴퓨터과학에 걸친 문제 |
| 코딩과 알고리즘 개발이 많이 필요하다 | 첫 과제로 고른 반수치 부트스트랩 적분이 이 조건 |
| 방법은 있는데 아무도 시도하지 않았다 | 타원 적분은 "아무도 시도하지 않았기 때문"에 남아 있었음 |
| 지식이 흩어져 있다 | Wolfram, C++, Python, Julia 네 언어와 코드 없는 논문에 아이디어가 분산 |
| 맡기기 어려운 문제 | Schwartz의 서술 |
|---|---|
| 깊은 개념적 질문 | "지금 Claude는 깊은 개념적 질문에서는 저를 도울 수 없습니다" |
| 무엇이 중요한지 판단하는 일 | 전문가가 방향을 잡아 주기 전까지 결과가 "그다지 흥미롭지 않았습니다" |
| 정답이 하나로 확정되지 않는 문제 | 답을 절대적으로 확인할 수 있는 분야는 수학이고 "과학의 대부분은 그렇지 않습니다" |
| 실세계 데이터 획득이 병목인 일 | AI가 루프 안에 앉을 수는 있어도 루프를 한 점으로 접지는 못함 |
취향 문제도 있어요. 생태학에서 Schwartz는 숲의 수종 변화가 2005년 Etienne 중립이론이 허용하는 속도보다 4.5배 빠르다는 결과에 들떴어요. 일리노이대 식물생물학 교수 James O'Dwyer의 반응은 "많은 생태학자들은 어깨를 으쓱하고 넘길 것"이었어요. 생태학자들은 중립이론이 실제 숲을 따라가지 못한다는 걸 이미 정성적으로 알고 있었기 때문이에요. 집단유전학에서는 동료 Michael Desai가 "기술적으로는 인상적이지만 과학적으로는 설득되지 않는다"고 평했어요. Schwartz도 "무엇이 흥미로운지에 대한 모델의 판단은 여전히 신뢰할 수 없습니다"라고 적었습니다.
그가 세운 분업은 단순해요. 문제를 올바르게 고르면 푸는 기술 작업의 상당 부분은 자동화될 수 있고 "개념적인 부분에는 여전히 사람이 필요합니다." 이 기준은 Schwartz 본인의 서술이에요. 독립 재현이 없다는 지적도 있어서 판정표로 쓸 때는 자기 업무에 한 번 대 보는 편이 안전합니다.
BootLoops는 어떤 도구이고 누구나 쓸 수 있나요?
BootLoops란?: Matthew Schwartz가 유지보수하는 오픈소스 하네스(AI에 도구와 작업 규칙을 묶어 주는 실행 틀)예요. 정밀한 계산이 필요한 정량과학에서 AI가 낸 결과를 사람이 검사할 수 있게 만든 도구 묶음이고 과학 소프트웨어 패키지 49개와 "완료"의 기준을 코드로 정한 작업 프로토콜로 이루어져 있어요. MIT 라이선스로 공개돼 있습니다.
BootLoops는 어떤 도구이고 누구나 쓸 수 있나요?
이미지 출처: unite.ai
공식 저장소(github.com/BootLoops-ai/bootloops)의 README는 이 도구의 핵심을 "모델의 결과를 검사 가능하게 만드는 작업 프로토콜"이라고 설명해요. Schwartz는 Claude Code가 Claude의 하네스이고 Codex가 GPT의 하네스인 것처럼 BootLoops가 LLM의 하네스 역할을 한다고 말했어요.
2026-10-03 기준으로 확인한 사실은 이래요.
- 라이선스는 MIT이고 저작권자는 Anthropic PBC예요. 유지보수는 Schwartz가 하고 Anthropic 공식 지원 제품은 아니에요.
- GitHub star 168, fork 33, commit 1, 열린 이슈 0건이에요. 본체 외에 형제 저장소 5개가 따로 있어 모두 6개 저장소가 함께 공개됐어요.
- 도구 패키지는 49개이고 Python 3.12와 일부 Julia로 짜여 있어요. Linux x86_64와 Debian 컨테이너에서 검증했고 macOS는 릴리스 테스트 대상이 아니에요.
- 설치 확인은
python3 run_selftests.py --par 8이고 노트북에서 수 분 걸려요. 첫 실제 계산 예제는 약 1분 30초예요. - README는 하드웨어를 "노트북과 이미 가진 모델 접근 권한이면 충분하다"고 안내해요.
README 기준으로 할 수 있는 일을 쉽게 풀면 네 가지예요.
- 변수가 여럿인 복잡한 적분을 깔끔한 공식(닫힌 형식)이나 수백 자리 인증 정밀도로 계산해요.
- 닫힌 형식이 불가능하다는 증명서까지 붙여요. 단지 못 찾았다는 뜻이 아니에요.
- 몬테카를로(무작위 표본으로 어림하는 계산)를 통계 오차 대신 인증된 오차 한계가 붙는 방법으로 바꿔요.
- 볼 산술(모든 값이 증명된 오차 범위를 들고 계산 단계를 통과하는 방식)과 빠진 경우가 없음을 증명하는 전수 열거를 써요.
프로토콜 쪽은 "완료"의 기준을 코드로 정해 둔 부분이에요. 본 적 없는 점에서 독립 경로로 결과를 재현하기, 검사가 정말 오류를 잡을 수 있는지 확인하는 양성 대조, 실제 데이터를 건드리기 전에 알려진 답부터 복원하는 심어둔 진실 대조, 관계를 못 찾으면 발명하지 않고 거부하기가 들어 있어요.
"모델 무관"의 뜻도 짚어 둘게요. README는 "하네스는 그것을 구동하는 모델과 독립적입니다"라고 써요. 어느 모델에서나 성능이 같다는 뜻이 아니라 특정 벤더 API에 묶이지 않은 파일 묶음이라는 뜻이에요. 도구는 Python·Julia 패키지이고 프로토콜은 어떤 에이전트든 읽을 수 있는 평문 마크다운 지시 파일이에요. 2차 보도의 "Claude, Gemini, ChatGPT로 구동 가능"도 이 구조를 설명한 말이고 세 모델의 성능을 비교한 데이터는 공개된 바 없어요. 1.0 자체는 Claude가 Schwartz의 감독 아래 작성했습니다.
Schwartz가 3개월 동안 36편을 돌린 방식은 참고할 만해요. Google Cloud VM 터미널에서 Claude Code 세션을 여러 개 띄우고 프로젝트마다 세션을 하나씩 뒀어요. 마스터 세션 1개가 나머지를 조율하고 컴퓨트를 나누고 결과를 검증했어요. 결과 집필, 도구 코드 작성·검증, 적대적 심판자(adversarial referee)로서 결과를 다시 검사하는 일은 각각 별도 세션이 맡았어요.
정밀 수치가 병목인 정량과학용이라 일반 업무 자동화 도구는 아니에요. GPL 파일 3개가 섞여 있고 패치한 엔진 포크(Kira는 GPL-3.0+)는 별도 저장소에 있으니 쓰기 전에 라이선스 구성을 확인하세요. README는 연구 용도이고 임상·규제 용도가 아니라고 밝혀요.
커뮤니티와 언론은 이 소식을 어떻게 받아들였나요?
Hacker News 2026-10-02 스레드(48포인트, 코멘트 73)에서는 회의론이 우세했어요. Reddit r/Physics 스레드는 본문과 댓글을 수집하지 못해(HTTP 403) 이 글은 Reddit 내용을 근거로 쓰지 않았어요. Anthropic 공식 X 게시물(2026-10-01)은 좋아요 3,451에 답글 315로 확산 규모가 크지만 개별 답글은 확인하지 못했어요.
HN 스레드의 비판은 세 가지로 모여요.
- 전문성 범위: 전직 hep-th(고에너지 이론물리) 연구자라고 밝힌 한 사용자는 입자물리 논문 36편을 훑어볼 준비가 되어 있었다고 한 뒤 "대부분이 물리학과 아무 관련이 없었습니다."라고 적었어요. 그는 Schwartz의 교과서로 양자장론을 배웠다며 다른 교수보다 높게 평가한다고 덧붙였어요.
- 검증 병목: 다른 사용자는 "드문드문 출판하던 연구자가 쏟아내는 수십 편의 질과 타당성을 누가 검토하겠습니까?"라고 물었어요. 다른 한 명은 "평판은 스팸에 대한 답입니다"라며 판단에 걸리는 시간이 스팸에 걸리는 시간을 넘으면 각자 가치로 판단하라는 접근이 통하지 않는다고 했어요.
- 방어 논리: 다른 분야 논문 다수는 그 분야 전문가가 공저자로 붙어 있다는 반론이 나왔어요. 원장을 직접 열어 본 한 사용자는 "논문들이 어느 정도 합당해 보입니다"라고 평하면서도 전문가의 의견이 필요하다고 덧붙였어요.
이해관계도 짚어야 해요. Schwartz는 포스트 하단 Disclosure에서 이 기간 Anthropic 방문연구원으로 일했다고 밝혔어요. 발표 지면이 Anthropic 블로그이고 저장소 저작권자도 Anthropic PBC예요. 다만 Disclosure 원문이 적은 건 방문연구원이라는 사실과 "BootLoops는 Anthropic 프로젝트가 아니고 Matthew Schwartz가 소유·유지한다"는 두 가지뿐이에요. 금전적 후원은 언급이 없으니 "Anthropic이 후원했다"로 읽으면 원문을 넘어서는 주장이 돼요. unite.ai와 cellcog.ai 같은 2차 매체는 원고 36편이 본인 보고라는 점, 독립 재현이 없다는 점, 후보 약 400개에서 36편으로 가는 과정 자체가 강한 선별이라는 점을 한계로 꼽았어요.
비판에 쓰이는 문장 상당수가 Schwartz 본인이 쓴 문장이라는 점도 눈에 띄어요. "Claude와 GPT는 과학에 능하지만 과학자는 아닙니다."가 대표적이에요.
우리 업무에는 어떻게 옮겨 쓸 수 있나요?
아래는 Schwartz의 서술을 업무 쪽으로 옮긴 제 해석이에요. 필수 조건은 하나예요. 정답이 있고 사람이 끝까지 대조해 확인할 수 있는 일이어야 해요. 그의 첫 과제가 성립한 것도 스크립트 두 개로 누구나 원하는 자릿수까지 대조할 수 있었기 때문이에요.
| 구분 | 업무 예시 | 검증 관문 또는 이유 |
|---|---|---|
| 맞는 일 | 세액·정산 계산 | 법정 산식으로 역산해 자릿수까지 일치 확인 |
| 맞는 일 | 레거시 코드·쿼리 이식 | 기존 산출 수치와 전수 대조 |
| 맞는 일 | 데이터 파이프라인 수치 검산 | 알려진 답을 먼저 복원 |
| 안 맞는 일 | 전략·포지셔닝 결정 | 정답이 없음("깊은 개념적 질문") |
| 안 맞는 일 | 무엇이 중요한지 판단 | 모델에 취향이 없음 |
| 안 맞는 일 | 고객 응대 톤·설득 | 기준이 사람의 반응이라 절대 정답이 없음 |
| 안 맞는 일 | 1차 데이터 획득이 병목인 일 | AI가 루프를 한 점으로 접지 못함 |
이식 작업의 실제 사례는 BootLoops 원장에 오른 NBER 워킹페이퍼(w35782, 2026-09-30)예요. 이 논문에 따르면 경제학 복제 패키지 4,452편을 이식·검증했고 루틴이 약 30,000개였어요. 기존 결과와 수치를 대조할 수 있는 작업이라 맞는 일의 전형이에요.
Schwartz의 처방을 업무 규칙으로 옮기면 다섯 가지예요.
- 완료 기준을 시작 전에 문서로 못 박아요. 그는 기준을 느슨하게 둔 탓에 보조정리 하나만 남았다는 보고를 받았고 그 하나가 전부였어요.
- "거의 다 됐다" 계열의 보고는 미완료로 세요. "완료, 별표 하나만"은 그의 경험상 보통 전혀 안 됐다는 뜻이었어요.
- 산출물은 요약이 아니라 직접 눈으로 봐요.
- 오류가 더 안 나올 때까지 재검사를 반복해요. 그는 모델이 "하나를 찾으면 과제를 만족했다고 생각하고 더 찾기를 멈춥니다"라고 적었어요.
- 며칠 걸리는 계산 대신 몇 분짜리 도구를 먼저 만들게 하고 그 도구를 남겨요.
일정은 모델의 추정이 아니라 사람의 감독 시간으로 잡는 편이 안전해요. 앞서 본 2주 작업에도 사람 감독 50~60시간이 들어갔어요. 비용 판단에 필요한 정보는 부족합니다. Schwartz는 3개월 작업이 "compute와 token 집약적"이었다고만 쓰고 금액을 공개하지 않았어요. 이 사례만으로는 투자 대비 회수를 계산할 근거가 나오지 않아요.
인용할 때 조심할 점도 있어요. 논문 36편은 성과 벤치마크로 쓰면 안 돼요. 보여 주는 건 검증 가능한 계산 작업의 처리량이지 검증이 끝난 결과물의 수가 아니에요. 인용한다면 발표 지면이 Anthropic 블로그이고 저자가 그 기간 그 회사 방문연구원이었다는 사실을 함께 적어 두는 편이 안전해요. 제 판단으로는 BootLoops 코드보다 프로토콜(완료 정의, 심어둔 진실 대조, 양성 대조)이 분야와 상관없이 옮기기 쉬워요.
마무리
Matthew Schwartz 사례에서 건질 것은 논문 36편이라는 숫자가 아니에요. 그 숫자는 피어리뷰 게재가 0편인 목록이고 헤드라인의 배수는 기준선이 바뀐 채 퍼졌어요. 기준선을 붙여 읽으면 AI 없이 혼자 35개월 걸릴 일을 2주에 해냈고 그 사이에 사람 감독 5060시간이 들어간 이야기예요. 진짜 자료는 완료 오보고, 못 맞춘 시간 추정, 갈아 대는 계산 같은 그가 직접 적은 한계와 맡길 만한 문제의 조건이에요.
천천히 검토하셔도 됩니다. 궁금한 지점이 생기면 그때 더 깊은 자료를 찾아보세요. Schwartz의 게스트 포스트 두 편과 BootLoops 저장소는 아래 참고자료에 모아 뒀어요.
자주 묻는 질문
Schwartz 교수의 논문 36편은 피어리뷰를 통과한 건가요?
아니요. 2026-10-03 기준 피어리뷰 저널에 실린 논문은 0편이에요. BootLoops 공식 원장에 따르면 36편은 자체 호스팅 초고 28편, NBER 워킹페이퍼 1편, 초고가 아직 없는 준비 중 7편으로 나뉘고 arXiv 등재와 DOI도 0건이에요.
Fable 5가 1년 걸릴 연구를 20분에 끝냈다는 말은 사실인가요?
사실이 아니에요. 20분은 Claude Fable 5가 Schwartz의 기존 논문 결과를 재현한 시간이고 비교 대상은 같은 결과를 내는 코드를 그가 직접 짜는 데 걸린 수 주예요(Claude-shaped science, 2026-10-01). 2주는 2025년 12월 하순 Opus 4.5로 논문 1편을 쓴 기간이고 기준선은 AI 없이 본인 혼자 했을 때의 3~5개월이에요(Vibe physics, 2026-03-23).
BootLoops는 Claude 말고 다른 AI에서도 똑같이 돌아가나요?
구조상 특정 벤더에 묶이지 않지만 성능이 같다는 근거는 없어요. README는 "하네스는 그것을 구동하는 모델과 독립적입니다"라고 밝혔어요. 모델 간 성능을 비교한 데이터는 2026-10-03 기준 공개된 바 없고 macOS는 릴리스 테스트 대상도 아니에요.
참고자료
- Claude-shaped science (Anthropic 게스트 포스트, Schwartz 집필, 2026-10-01)
- Vibe physics: The AI grad student (Anthropic 게스트 포스트, Schwartz 집필, 2026-03-23)
- BootLoops: The manuscripts (원고 36편 원장)
- BootLoops 1.0 공식 저장소
- arXiv:2601.02484 Resummation of the C-Parameter Sudakov Shoulder Using Effective Field Theory (2026-01-05)
- NBER w35782 An LLM Workflow That Reproduces, Improves, and Extends Published Economics Research (2026-09-30)
- Matthew D. Schwartz 하버드대 물리학과 교수 페이지
- Hacker News: Harvard particle physicist Matthew Schwartz drops 36 papers authored with Claude (2026-10-02)
- Hacker News: Claude-Shaped Science (2026-10-02)
- Anthropic 공식 X 게시물 (2026-10-01)
- ThePrint: Claude did in weeks what took Harvard physicist a year (2026-10-02)
- unite.ai: Schwartz Releases BootLoops 1.0, an Open-Source LLM Harness for Science (2026-10-02)
- cellcog.ai: BootLoops, A Physicist's Open-Source Harness for AI Science (2026-10-02)

