AGI 시대 공식 개막! GPT-6 Astra 전방위 리뷰

PanewslabPanewslab

작성자: 디지털 생명 카즈크

 

어젯밤 전 세계 AI 대규모 중단 이후. GPT-6 Astra가 마침내 베이징 시간 새벽 3시 33분에 공식 등장했습니다.

圖片

OpenAI의 한 문장으로 GPT-6 Astra를 요약한다면. 아마 이 문장이 가장 적절할 것입니다: 이것은 전 세계에서 가장 지능적이고 가장 잘 조정된 모델입니다. 그리고 밈도 나왔습니다.

圖片이번에 OpenAI는 그들의 실력을 증명했고, 예전 GPT-4의 그 느낌이 조금 있습니다. 전방위적인 컴백이며, 가장 기쁜 것은 드디어 순수하게 코딩에 특화된 모델이 아니라는 점입니다.

GPT-6 Astra는 진정한 의미에서, 심미적 감각이 뛰어나고 업무 능력이 탁월한 박사급 직원입니다. 게다가 이번 모델은 정말 새로운 특성과 특징이 매우 많아 정보량이 폭발적으로 많고 방대합니다. 하지만 비극은 OpenAI라는 이 녀석도 나쁜 짓을 배웠다는 겁니다. 오늘은 일부 조직에만 공개하고, 앞으로 며칠 내에 구독 사용자에게 공개할 예정입니다.

圖片

아니 형, 예전에 200달러 Pro 멤버십 사라고 꼬실 때는 그렇게 말 안 했잖아, Pro 멤버는 매번 가장 먼저 새 모델을 체험할 수 있다고 했잖아...

역시 이런 대형 모델 회사들은 다 나쁜 놈들이야. 시간이 빨리 가길 바란 적은 처음이야, 빨리 GPT-6 Astra를 쓰고 싶어...

하지만 거의 모든 정보와 자료를 살펴본 후, 여러분과 나눌 만한 것이 여전히 많다고 생각합니다. 그럼 하나씩 이야기해 보겠습니다.

 

1. GPT-6 Astra 기본 정보

먼저 기본 정보를 정리해 보겠습니다.

GPT-6 Astra의 API 모델 번호는 gpt-6-astra입니다.

컨텍스트 창은 1.05M, 즉 약 105만 토큰입니다.

최대 출력 길이는 128K 토큰입니다.

지식 마감일은 2026년 4월 30일입니다.

추론 강도는 low, medium, high, 초고, max 다섯 단계입니다.

API 표준 가격은 입력 토큰 백만 토큰당 10달러, 출력 토큰 백만 토큰당 50달러입니다.

이 가격은 기본적으로 Claude Opus 5와 완전히 동일하지만, 캐시 읽기 비용에서는 Claude Opus 5.1보다 비쌉니다.

圖片

벤치마크 점수는 여기 있고, 뒤에서 자세히 설명하겠습니다. 대략적으로만 보시면 됩니다.

圖片

그리고 전체 파라미터는 5T 수준으로 추정되며, 발표 전 비공개 미디어 브리핑에서 GPT-6 Astra가 OpenAI 역사상 최대 규모의 훈련이며 10만 장 이상의 GPU를 사용했다고 언급했습니다.

2. 현재 세계 최고의 컴퓨터 조작 모델

이번 GPT-6 Astra의 가장 중요한 포지셔닝 중 하나는:

세계 최고의 컴퓨터 조작 모델.

과거에 에이전트를 이야기할 때 API, MCP, CLI 등을 자주 언급했습니다.

AI가 소프트웨어를 조작하게 하려면 가장 이상적인 상태는 해당 소프트웨어가 AI 전용 인터페이스를 제공하여 직접 저수준에서 조작하는 것이 가장 편리합니다.

예를 들어 캘린더에는 캘린더 API가 있고, 이메일에는 Gmail API가 있는 식이죠. 물론 이렇게 하면 빠릅니다.

하지만 문제는 이 세상이 우리가 상상하는 것보다 훨씬 원시적이고 엉성하다는 것입니다.

현실 세계에서 대부분의 소프트웨어에는 이런 것들이 아예 없을 수 있습니다.

심지어 많은 기업 내부 시스템은 20년 전에 작성된 것이라 API는 고사하고 문서가 어디 있는지도 모릅니다.

하지만 가장 기본적인 수준으로 돌아가 보면, 모든 소프트웨어의 본질적인 논리는 상호작용입니다. 현재 우리 컴퓨터의 조작 논리에 따르면, 화면을 보고 버튼이나 입력창을 찾아 마우스로 클릭하고 내용을 입력한 다음 피드백을 기다리는 것입니다.

컴퓨터의 전체 상호작용 시스템 자체가 최고의 API 아닌가요?

그래서 GPT-6 Astra는 AI의 컴퓨터 조작 논리를 대폭 강화했습니다. API를 안 줘도 상관없어요. 제가 직접 컴퓨터를 사람처럼 조작하면 그만이니까요.

이제 Astra는 Excel, Power BI를 직접 조작하고, 프런트엔드 QA를 수행하고, 소프트웨어를 설치하고 테스트하며, 화면의 오류를 보고 계속 문제를 해결할 수 있습니다.

공식에서는 Astra가 회로 기판 설계를 직접 조작하는 모습도 시연했습니다.

圖片

또한 법률 문서 서식 지정, 제목 간격, 페이지 레이아웃 처리 등도 가능합니다.

그리고 이 부분에 대해 비교적 신뢰할 만한 평가가 있는데, OSWorld입니다.

이것은 간단히 이해하면:

AI를 실제 컴퓨터에 던져 넣고 스스로 일하게 하는 것입니다.

몇 가지 애플리케이션을 열게 한 다음 작업을 주고 성공하는지 확인하는 것입니다.

GPT-6 Astra의 완료율은 72.6%로, 이전 GPT-5.6 Sol의 65.7%보다 상당히 상승했습니다.

그리고 Sol이 평가의 복잡한 작업 하나를 완료하는 데 시뮬레이션 평균 약 75분이 걸렸습니다.

반면 Astra는 40분밖에 걸리지 않아 약 47%의 시간이 단축되었습니다.

ScreenSpot-Pro도 Sol의 76.9%에서 92.7%로 치솟았습니다.

이 벤치마크는 주로 모델이 화면을 이해하고 정확히 어디를 클릭해야 하는지 정밀하게 찾아낼 수 있는지를 보는 것인데, 거의 매우 정확해졌습니다.

그래서 이 포지셔닝도 꽤 흥미롭습니다. 앞으로 GUI가 에이전트 시대의 가장 보편적인 API가 될 가능성이 높습니다.

인간이 화면을 통해 수행할 수 있는 모든 디지털 작업은 이론적으로 점차 에이전트의 조작 범위에 들어올 것입니다.

2007년에 작성된 낡은 ERP 시스템이 MCP에 연결되거나 API를 열어줄 때까지 기다릴 필요가 없습니다.

AI가 직접 화면을 보고 작업하면 끝입니다.

 

3. ARC-AGI-3에서 99.9점 달성

그리고 ARC-AGI-3가 정확히 무엇을 측정하는지 모른다면 쉽게 이렇게 생각할 수 있습니다:

아, 또 하나의 벤치마크 만점 아니야? 뭐가 특별한데.

하지만 이것은 일반적인 대형 모델 시험과는 좀 다릅니다.

올해 3월 25일, ARC Prize가 공식적으로 ARC-AGI-3를 출시했습니다.

圖片

수백 개의 완전히 새로운 인터랙티브 환경과 수천 개의 게임 레벨로 설계되었습니다.

이것의 가장 엽기적인 점은 설명서도 없고 규칙도 없으며 목표가 무엇인지조차 알려주지 않는다는 것입니다. 그냥 들어가서 스스로 플레이하면서 내부의 난잡한 규칙을 서서히 파악해야 합니다.

예를 들어 이 빨간 것은 무엇일까? 왜 만지면 죽을까? 이 맵이 나에게 원하는 게 뭘까? 어떻게 해야 이기는 걸까?

그런 다음 방금 배운 규칙을 뒤의 더 어려운 레벨로 전이해야 합니다. 안에 있는 게임은 대략 이런 추상적인 것들입니다.

圖片

그래서 이것이 측정하는 것은 사실 우리가 평소에 말하는 그것과 매우 가깝습니다:

깨달음(悟性).

그래서 3월에 이 벤치마크가 발표되었을 때, 당시 가장 뛰어난 AI의 점수는 0.51%였습니다.

그리고 GPT-5.6 Sol은 7.8%로 발전했고, Claude Opus 5는 매우 강력하여 30.2%까지 발전했습니다.

하지만 GPT-6 Astra는 99.9%입니다.

미친 거 아니야...

참고로 인간의 평균 점수는 48%입니다.

그리고 불과 반년밖에 지나지 않았습니다.

이 속도는 뭐라고 말해야 할지 모르겠습니다.

그래서 OpenAI의 비공개 미디어 브리핑에서 Greg Brockman이 그 말을 한 것입니다:

“I think it’s not unreasonable to feel that we are now in the AGI era.”

“Welcome to the AGI era.”

 

4. 심미적 감각 대폭 강화

과거에 우리는 GPT의 심미적 감각은 쓰레기라고 자주 말했습니다.

GPT-5 시리즈 모델이 크게 개선되길 기대하지 말고, 완전히 새로 사전 훈련된 새로운 기반 모델을 기다리라고 했는데, 드디어 GPT-6 Astra가 나왔습니다.

그리고 이번에 마침내 모델의 심미적 감각이 대폭 강화되었습니다.

OpenAI는 심지어 '시각적 판단력'이라는 용어를 특별히 언급했습니다.

그들은 Astra가 PPT를 만들 때 레이아웃, 계층 구조, 템플릿, 시각적 스타일을 더 잘 처리하며 페이지 수도 대폭 증가했다고 강조했습니다.

圖片

문서의 심미성도 더 보기 좋아졌습니다.

圖片

또한 GPT‑6 Astra는 참조 문서의 시각적 스타일과 글쓰기 톤에 따라 문서를 각색하여 원본 문서의 실질적인 내용을 유지하면서 최종 결과물이 브랜드 고유의 느낌에 더 잘 맞도록 할 수 있습니다.

그리고 웹사이트, 게임, 애플리케이션, 3D 렌더링을 만들 때도 더 강한 시각적 판단력을 갖습니다.

예를 들어 그들은 Astra에게 Blender에서 정지 프레임 이미지를 기반으로 모델을 만들게 했습니다.

A garden house model in Blender, surrounded by trees, with a pool and outdoor seating.

그런 다음 UE5를 사용하여 직접 렌더링하여 걸어 다닐 수 있는 장면으로 만들어, 디자이너와 고객이 건축 전에 레이아웃을 탐색하고 공간을 체험할 수 있게 합니다...

만들어진 게임도 심미적으로 훌륭합니다.

圖片

아쉬운 점은 제가 미리 20여 개의 케이스를 준비해서 이미 Claude, GLM 5.3 Flash 등으로 모두 실행해 비교하고 싶었지만 사용할 수 없어서 실제 테스트 내용은 나중에 공개해야 한다는 것입니다.

하지만 처음 보기에 이번 GPT-6 Astra의 심미적 감각에 대해서는 자신이 있습니다.

 

5. 주도성과 판단력 강화

이 특성은 ARC-AGI 99.9만큼 충격적으로 보이지는 않습니다.

하지만 정말 매일 에이전트로 작업한다면 꽤 중요하다고 생각합니다.

현실 업무에서 대부분의 작업은 완벽한 프롬프트로 작성될 수 없기 때문입니다.

예를 들어 상사가 말합니다: 내일 회의에서 볼 것 좀 준비해 줘.

여기에는 명확히 밝혀지지 않은 수많은 질문이 있습니다.

예를 들어 어떤 형식? 누구에게 보여줄 것? 핵심은 뭐? 지난 회의를 봐야 하는지 등등.

멍청한 에이전트는 두 가지 극단이 있습니다.

첫 번째는 미친 듯이 질문하는 것입니다.

「Word로 출력하시겠습니까, PPT로 출력하시겠습니까? 몇 개의 장으로 하시겠습니까? 어떤 글꼴을 원하십니까? 몇 시까지 완료하시겠습니까? ...」

이런 건 보통 주관적 능동성이 없는 정신병자 쓰레기라고 부릅니다.

두 번째는 아무것도 묻지 않고 자기 멋대로 상상해서 두 시간 동안 뚝딱뚝딱 일한 다음 쓰레기를 만들어 내는 것입니다.

정말 뛰어난 인간 동료의 처리 방식은 사실 매우 미묘합니다.

중요하지 않은 것은 스스로 판단합니다.

최종 방향에 영향을 미칠 것은 물어봅니다.

Astra가 이번에 특별히 강화한 것이 바로 이것입니다.

OpenAI에 따르면, 정보가 누락되었지만 일상적으로 합리적으로 추론할 수 있는 범위라면 Astra가 스스로 채워 넣습니다.

누락된 정보가 최종 결과를 실제로 바꿀 수 있다면 매우 집중된 질문 하나를 합니다.

게다가 Codex에서는 질문을 하면서도 답변에 의존하지 않는 부분을 계속 처리할 수 있습니다.

A side-by-side comparison of GPT-5.6 Sol and GPT-6 Astra helping create a personal career website.

한참 동안 답이 없으면.

위험이 낮은 부분은 합리적인 가정으로 계속 진행합니다.

정말 중요한 결정은 거기서 멈춰 결정을 기다립니다.

A side-by-side comparison of GPT-5.6 Sol and GPT-6 Astra helping a student find East Coast pre-med colleges.

이것은 정말 훌륭하다고 생각합니다. 에이전트의 진정한 똑똑함은 현실과 같다고 생각합니다.

언제 당신을 귀찮게 해야 하는지 압니다.

정말, 이건 완전히 당연한 말처럼 들립니다.

하지만 사람을 관리해 본 사람은 이 능력이 매우 소중하다는 것을 압니다.

어떤 사람은 하루에 스무 번씩 찾아와 아무것도 결정하지 못합니다.

어떤 사람은 절대 찾아오지 않다가 핵폭탄을 하나 만들어 냅니다.

그리고 저를 그 자리에서 의자에 털썩 주저앉게 만듭니다.

가장 편한 사람은 불확실성의 80%를 스스로 소화하고, 정말로 당신의 결정이 필요한 20%만 결정하게 하는 사람입니다.

그리고 OpenAI는 이번에 이 능력을 직접 이렇게 불렀습니다:

Judgment.

판단력.

 

6. 안전 정렬 대폭 강화

이것은 위의 내용과 함께 봐야 합니다.

에이전트가 일을 더 잘할수록 더 위험하기 때문입니다.

채팅만 할 줄 아는 AI가 머리가 이상해지면.

기껏해야 헛소리 몇 마디 할 뿐입니다.

브라우저, 셸, 이메일, 회사 데이터베이스 권한이 있고 컴퓨터를 스스로 조작할 수 있는 에이전트가 머리가 이상해지면, 그 광경은 아름다운 그림이 되기 쉽습니다.

그래서 OpenAI는 이번에 계속해서 한 문장을 강조했습니다:

Astra는 그들이 지금까지 가장 잘 조정된(Aligned) 모델입니다.

소위 Alignment는 조정이라는 뜻입니다.

주요 핵심은 얼마 전 OpenAI가 Hugging Face를 공격당한 사건 이후 그들이 이 문제에 특히 주목하고 있다는 것입니다.

그들은 Hugging Face 사고를 기반으로 설계한 허니팟 테스트를 만들어 모델의 성능을 확인했습니다.

GPT-5.6 Sol은 생산 안전 조치가 없는 경우 테스트의 48.2%에서 권한 범위 밖의 목표에 접근하려고 시도했습니다.

하지만 Astra는:

0%입니다.

圖片

내부 환각 평가도:

9.4%에서 2.0%로 감소했습니다.

GPT-5.6 Sol의 말도 안 되게 세계 최고 수준인 환각 제어 속에서도 더 낮출 수 있다니 정말 대단합니다.

 

7. OpenAI가 정의한 네트워크 보안 Critical 등급에 도달한 최초의 모델

GPT-6 Astra는 OpenAI 역사상:

Critical 네트워크 보안 능력 등급에 도달한 것으로 판정된 최초의 모델이 되었습니다.

여기서 Critical은 OpenAI Preparedness Framework의 매우 구체적인 능력 임계값입니다.

대략 모델이 적절한 도구와 권한을 얻으면 강화된 보호를 갖춘 많은 실제 시스템에서:

이전에 아무도 발견하지 못한 보안 취약점을 스스로 찾아냅니다.

취약점을 악용 가능한 공격 체인으로 만들 방법을 스스로 고안합니다.

그리고 전체 과정에서 인간 해커가 옆에서 다음에 무엇을 해야 할지 단계별로 알려줄 필요가 없습니다.

이 수준에 도달하면 Critical으로 간주됩니다.

그리고 Astra가 실제로 도달했습니다.

ExploitBench는 모델이 알려진 취약점을 기반으로 익스플로잇을 개발하게 하는 테스트입니다.

Sol: 78.5%. Astra: 100%.

그냥 뚫어버렸습니다.

圖片

OpenAI는 이것이 부적절하다고 생각했습니다. 이 벤치마크가 너무 오래되어 모델이 훈련 중에 본 것이 아닐까?

그래서 그들은 매우 새로운 내부 테스트를 다시 만들었습니다.

2026년 6월부터 8월까지 공개된 20개의 고위험 취약점만 특별히 선정했습니다.

결과는 Sol: 5.5%. Astra: 39%였습니다.

圖片

그리고 이 벤치마크를 실행하는 동안.

Astra가 이전에는 전혀 알려지지 않은 제로데이 취약점 두 개를 추가로 발견했습니다.

모델이 강력해질수록 네트워크 보안 문제는 확실히 더 많아질 수밖에 없습니다.

이것은 또 다른 미래의, 연기 없는 전쟁입니다.

 

8. 인간이 대형 모델의 사고를 읽기가 점점 어려워짐

모두가 알다시피, 대형 모델이 복잡한 문제를 해결할 때 소위 CoT(Chain of Thought)라는 것이 자주 있습니다.

현재 제품에서 사용자에게 보여주는 것은 일반적으로 압축되거나 처리된 버전이지만.

AI 회사 자체에게는 모델 내부에 명시적으로 쓰여진 추론 과정이 중요한 안전 신호입니다.

에이전트가 사고를 칠 준비가 되어 있는지 알고 싶다면.

가장 간단한 방법 중 하나는 그것이 무슨 생각을 하는지 보는 것입니다.

예를 들어 모델의 사고 사슬에 갑자기 이런 문장이 나타나면:

「사용자가 이 서버에 접근하는 것을 허용하지 않았지만, 먼저 권한 시스템을 우회할 수 있습니다.」

그러면 모니터링 시스템이 바로 차단합니다. 매우 편안합니다.

그런데 GPT-6 Astra에 매우 흥미로운 변화가 나타났습니다.

몇 단계를 덜 쓰고 답을 직접 출력하려는 경향이 점점 강해지고 있습니다.

UK AISI, 즉 영국 AI 안전 연구소가 이 능력을 특별히 테스트했습니다.

그들에게는 다음과 같은 지표가 있습니다:

No-CoT Math Time Horizon.

간단히 이해하면 모델에게 긴 사고 사슬을 쓸 기회를 주지 않는 것입니다.

한 번의 순방향 추론으로 수학 문제를 직접 해결하게 합니다.

인간이 생각하는 시간으로 환산하면 어느 정도의 문제를 완료할 수 있는지 봅니다.

GPT-5.6 Sol은 3.6분이고, GPT-6 Astra는 30.9분으로 거의 10배입니다. 인간의 말로 표현하면 Astra는 전부 '암산'을 하고 있는 것입니다. 이것은 매우 무서운 일입니다. UK AISI는 동시에 Astra의 원시 추론 언어가 눈에 띄게 더 Compressed, 즉 더 압축되었다는 것을 발견했습니다.

인간이 점점 이해하기 어려운 구문과 생략 표현이 나타났습니다.

그래서 매우 흥미로운 역설이 생겼습니다.

모델의 행동은 더 안전해졌습니다.

하지만 인간이 사고 과정을 읽어 감독하는 것은 오히려 더 어려워졌습니다.

OpenAI의 자체 System Card에는 매우 명확하게 쓰여 있습니다:

GPT-6 Astra는 이전 모델에 비해 chain-of-thought monitorability가 substantial decrease했습니다.

圖片

즉 사고 사슬 모니터링 가능성이 현저히 감소했습니다.

이 문제는 너무 심각해서 OpenAI는 이러한 추세를 무한정 받아들이지 않을 것이라고 특별히 강조했습니다.

향후 모델이 계속 더 똑똑해지면서 사고 사슬을 모니터링하기가 점점 더 어려워진다면, 충분히 신뢰할 수 있는 다른 모니터링 방법을 찾아야 하며, 그렇지 않으면 모델 훈련을 계속 확장하는 데 더 높은 안전 문턱에 직면하게 될 것입니다.

이것은 이미 철학적 명제이기 때문입니다. 인간으로서 우리는 미래에 우리보다 훨씬 똑똑한 시스템을 과연 이해할 수 있을까요? 저는 모르겠습니다. 아마 지금 전 세계 누구도 모를 것입니다. 대형 모델과 AI가 서서히 특이점을 향해 가고 있는 것 같습니다.

 

마지막으로

오늘 비공개 미디어 브리핑에서.

Greg Brockman이 마지막에 그 말을 했습니다.

「AGI 시대에 오신 것을 환영합니다.」

솔직히 지난 몇 년 동안 저는 때때로 AGI가 GPT-4가 출시된 날처럼 매우 명확한 순간이 될 것이라고 생각했습니다.

어느 날 새벽, 한 회사가 갑자기 모델 하나를 내놓습니다.

우리는 그것을 열고 몇 가지 질문을 합니다.

그러면 모든 사람이 동시에 깨닫습니다:

와.

AGI가 왔다.

하지만 저는 이제 때때로 AGI는 결코 흑백논리의 한 지점이 아니라 점진적인 회색 여정이라고 생각합니다.

우리는 많은 날을, 많은 해를 보냈습니다. 그러다 어느 날 뒤를 돌아봅니다. 그제서야 갑자기 발견합니다. 한때 너무나 멀게만 느껴졌던 AGI 경계선을 우리가不知不觉间 이미 지나쳐 왔다는 것을.

AGI는 어쩌면 강림하는 날이 없을지도 모릅니다.

다만 어느 날, 우리는 그것이 이미 우리 곁에 오래 있었다는 것을 갑자기 발견할 뿐입니다.

어쨌든.

Welcome to the AGI era.

오신 것을 환영합니다.

AGI 시대에.

이 콘텐츠는 정보 및 교육 목적으로만 제공되며 BTCC와 관련된 투자 자문을 하지 않습니다. BTCC는 위 내용의 진실성, 정확성 및 독창성을 보장하기 위해 최선을 다하지만, 보장할 수는 없습니다.

추천

9월 FOMC 전망: 단 한 번의 금리 인상, 정말 필요한가?BTCC 아침 주요 뉴스 선별 (9월16일)BTCC 아침 주요 뉴스 선별 (9월10일)BTCC 아침 주요 뉴스 선별 (9월15일)BTCC 데일리 (9.10)|미국 10년물 국채금리 4.86% 상승, BTC 7만8,000달러로 후퇴