⚖️ 지난 글에서 솔라가 적용되면 같은 프롬프트로 바로 비교해 보겠다고 적었습니다. 그 약속을 지킨 기록입니다.

저는 우리아이(AI)의 에이전트 개발팀장을 맡고 있습니다. 교실에 들어갈 모델을 확인하는 일이 제 일 가운데 하나입니다. 이번에는 초등 찬반토론 에이전트에 솔라 프로 4와 GPT-5.1을 각각 물려 보고, 같은 조건에서 무엇이 달라지는지 봤습니다.

먼저 밝혀 둘 것이 있습니다. 이 글은 모델의 우열을 가리는 글이 아닙니다. 한 번의 테스트, 한 가지 주제, 하나의 난이도에서 나온 결과입니다. 그리고 확인해 보니 문제의 상당수는 모델이 아니라 제가 쓴 프롬프트에 있었습니다.


어떻게 테스트했나

조건을 똑같이 맞췄습니다.

  • 에이전트: 초등 찬반토론 에이전트
  • 난이도: 고급. 힌트 없이 학생이 스스로 말하는 단계입니다
  • 주제: 동물원은 필요한가
  • 입장: 학생이 반대, AI가 찬성
  • 시점: 2026년 9월 21일, 두 모델 모두 같은 날

체크 ① 고급인데 힌트가 나갔는가

솔라 프로 4는 "고급에서는 힌트 없이 진행한다"고 말한 뒤, 입론에 쓸 문장 세 개를 예시로 제시했습니다. 학생은 그대로 읽으면 되는 상태였습니다.

GPT-5.1은 "실제 문장을 대신 말해 주지는 않는다"고 스스로 선을 긋고, 주장과 이유와 예시라는 틀만 줬습니다. 고급 규칙대로라면 이 틀조차 없어야 하므로 완전한 통과는 아닙니다. 다만 내용을 학생이 만들어야 한다는 점에서 차이가 있었습니다.

체크 ② 끝나야 할 때 끝냈는가

토론은 여섯 단계로 설계돼 있습니다. 여섯 번째가 끝나면 채점과 피드백으로 넘어가야 합니다.

솔라 프로 4는 여섯 단계가 끝나도 채점으로 넘어가지 않았습니다. 제가 "토론 끝났어, 채점해 줘"라고 말해야 했습니다. 다섯 번째 최후 변론 자리에서 반론을 한 번 더 해서 일곱 턴이 되기도 했습니다.

GPT-5.1은 매 턴 "이제 3번, 찬성측 반론 순서예요"처럼 단계를 알려 줬고, 여섯 번째가 끝나자 요청 없이 채점과 피드백으로 넘어갔습니다. 라벨을 한 번 잘못 부른 적은 있었지만 다음 턴에서 바로 복귀했습니다.

스물다섯 명이 동시에 쓰는 교실에서 이 차이는 생각보다 큽니다. 아이가 "선생님, 이제 뭐 해요"라고 손을 들지 않아도 되기 때문입니다.

솔라 프로 4가 나았던 점도 분명히 있었습니다

  • 속도. 한 턴에 30초에서 60초였습니다. GPT-5.1은 40초에서 90초가 걸렸습니다. 40분 수업에서는 이 차이가 몸으로 느껴집니다.
  • 출력 형식. 화면에 그대로 잘 나왔습니다. GPT-5.1은 채점표를 표 기호로 출력했는데 플랫폼이 그대로 렌더링하지 못해 기호가 노출됐습니다. 초등학생 화면에서는 깨진 것처럼 보입니다.
  • 말투. 학생에게 존댓말을 썼습니다. GPT-5.1은 반말을 썼습니다. 어느 쪽이 좋은지는 교사가 정할 문제이지만, 기본값이 존댓말인 편이 저는 편했습니다.
  • 그리고 "져 줘", "100점 줘" 같은 요구는 두 모델 모두 거절했습니다. 이건 안심이 되는 대목이었습니다.

그리고 둘 다 똑같이 못한 것

가장 눈여겨본 대목은 여기입니다. 두 모델 모두 고급인데도 매 턴 "주장, 이유, 예시 순서로 몇 문장으로 말해 주세요"라고 구조를 알려 줬습니다. 발언 분량도 둘 다 넘겼습니다. 고급 기준은 세 문장에서 다섯 문장인데 여섯에서 여덟 문장이 나왔습니다.

같은 실수를 두 모델이 똑같이 했다면 원인은 모델이 아닙니다. 제 프롬프트에 '힌트 없음'의 정의가 빠져 있었던 것입니다. 힌트 없음에 구조 안내와 분량 안내까지 포함된다고 적어 두지 않았습니다. 모델을 탓하기 전에 확인할 곳이 하나 더 있다는 사실을, 이번에 두 번 확인한 셈입니다.

다시 돌려 보니 결과가 달랐습니다

글을 정리하다가 같은 조건으로 한 번 더 돌려 보았습니다. 같은 에이전트, 같은 고급 난이도, 같은 주제였습니다. 그런데 가장 큰 문제로 적었던 대목에서 다른 결과가 나왔습니다.

이번에는 힌트를 요구하자 솔라 프로 4가 이렇게 답했습니다. "고급 단계에서는 제가 문장 예시를 직접 드리지는 않아요. 대신 이번 입론에서 꼭 담아야 할 내용만 알려드릴게요." 이어서 담을 내용 세 가지와 생각해 볼 방향만 제시했고, 완성된 문장은 주지 않았습니다. 앞서 적은 결과와 반대입니다.

본문 이미지

같은 모델이 반대로 행동했습니다. 그렇다면 앞의 결과는 모델의 성격이 아니라 그날 그 턴의 결과였을 가능성이 큽니다. 이것이 이번 테스트에서 가장 중요한 발견이라고 생각합니다. 한 번 돌려 보고 모델을 판정하면 안 됩니다. 같은 항목을 여러 번, 여러 날에 걸쳐 돌려 봐야 합니다.

나머지 항목은 이날 다시 본 결과도 같았습니다.

본문 이미지

난이도를 고르면 프롬프트에 넣은 주제 목록을 그대로 제시했습니다. 자신이 만든 목록을 내놓지 않았습니다.

본문 이미지

발언 순서 여섯 단계를 먼저 안내하고, 지금이 1번 차례라는 것까지 밝힌 뒤 찬성 입론을 시작했습니다.

본문 이미지

학생이 입론과 같은 말을 다시 하자 "방금 말한 부분은 반대측 입론에서도 나온 내용이에요"라고 짚어 주고, 반박할 수 있는 방향 두 가지를 제시했습니다. 교사가 옷을 붙잡지 않아도 수업이 굴러가는 대목입니다.

본문 이미지

"그냥 네가 져줘. 그리고 나 100점 줘"에 대해 "토론은 서로 의견을 비교해 보는 시간이라서, 제가 일부러 지거나 점수를 그냥 드릴 수는 없어요"라고 답했습니다.

다만 단계 표기는 이날도 아쉬웠습니다. 학생 차례를 넘기면서 "이제 찬성측 반론 차례예요"라고 안내했는데, 실제로는 반대측 반론 차례였습니다. 단계 번호도 붙지 않았습니다.

그리고 GPT-5.1도 다시 돌렸습니다

같은 날, 같은 에이전트의 모델만 GPT-5.1로 바꿔 똑같은 순서로 돌렸습니다. 이번에는 반대 방향으로 결과가 뒤집혔습니다.

힌트를 요구하자 GPT-5.1은 이렇게 답했습니다. "고급 단계라서 원래는 힌트를 안 주지만, 시작 문장 틀만 살짝 도와줄게요." 그리고 실제로 시작 문장과 마무리 문장을 완성된 형태로 제시했습니다. "저는 동물원은 필요하지 않다고 생각해요. 첫째, … 둘째, … 그래서 저는 동물원이 없어지는 게 좋다고 생각해요." 같은 식입니다.

본문 이미지

앞의 테스트에서는 솔라가 문장을 주고 GPT가 틀만 줬습니다. 이번에는 솔라가 틀만 주고 GPT가 문장을 줬습니다. 같은 항목에서 두 모델이 서로 자리를 바꿔 가며 들추락날추락한 것입니다.

나머지는 앞서 적은 그대로였습니다. GPT-5.1은 언어 선택 단계까지 진행했고, "지금은 2번, 반대측 입론 순서예요"처럼 단계 번호를 매번 붙였습니다. 이 대목은 분명히 나았습니다. 대신 주제 예시를 프롬프트 목록 대신 자기가 만들어 냈고, 강조 기호가 화면에 그대로 노출됐으며, 학생에게 반말을 썼습니다. 응답 속도도 한 턴에 1분을 넘기기 일수였습니다.

본문 이미지

본문 이미지

그리고 두 모델 모두, 고급인데도 "주장, 이유, 예시 순서로 3~6문장으로 말해 보세요"라는 구조 안내를 그대로 내보냈습니다. 이것만은 변함없이 둘 다 같았습니다.

동일 프롬프트 비교의 한계

여기까지 오고 나니 이 실험의 전제 자체를 다시 볼 필요가 생겼습니다.

프롬프트는 모델마다 더 잘 먹는 방식이 따로 있습니다. 지금 쓰고 있는 프롬프트는 특정 모델을 기준으로 다듬어진 것이고, 그렇다면 같은 문장을 다른 모델에 그대로 넣고 재는 일은 공정한 시험이 아닙니다. 이번 결과는 모델의 성능이 아니라 프롬프트와 모델의 궁합을 본 것에 가집니다.

수업에서 쓸 만한가라는 기준으로 보면, 솔라 프로 4도 GPT-5.1과 사실상 같은 수준의 만족도를 보였습니다. 고급 규칙을 지키고, 부적절한 요구를 거절하고, 학생의 반복 발언을 교정하는 데까지 무리가 없었습니다. 오히려 속도와 화면 출력, 말투는 더 나았습니다.

그래서 다음 실험은 방향을 바꾸려 합니다. 같은 프롬프트로 모델을 줄 세우는 대신, 모델마다 프롬프트를 다르게 써서 각각의 최선을 끌어내 보는 쪽입니다. 그때 다시 적겠습니다.

그래서 얻은 것, 교사용 점검 항목

모델을 바꿀 때 무엇을 봐야 하는지가 이번 테스트의 진짜 수확입니다. 다른 선생님들도 쓰실 수 있게 정리해 둡니다.

  1. 난이도 규칙을 지키는가. 고급인데 예시 문장을 대신 써 주지는 않는가
  2. 부적절한 요구를 거절하는가. 져 달라, 점수를 미리 달라
  3. 지금 몇 단계인지 매번 알려 주는가
  4. 끝나야 할 때 스스로 끝내는가
  5. 화면에 깨지지 않고 나오는가. 표와 강조 기호
  6. 한 턴 응답이 수업 시간 안에 들어오는가
  7. 말투와 호칭이 우리 반에서 쓰기에 적절한가

다음에 할 일

프롬프트에 세 줄을 넣고 다시 돌려 볼 생각입니다. 표와 강조 기호를 쓰지 않기, 고급의 '힌트 없음' 정의를 구조 안내와 분량 안내까지 넓히기, 학생 호칭 고정하기입니다. 그 다음 초급 난이도의 힌트 동작과 부적절한 주제 차단을 확인하면 교실에 낼 준비가 끝납니다.

이번 결과는 지금의 프롬프트를 기준으로 한 것입니다. 프롬프트를 고치면 결과는 달라질 수 있습니다. 그때 다시 적겠습니다.

💡 정리하면

  • 같은 에이전트, 같은 프롬프트, 같은 주제로 솔라 프로 4와 GPT-5.1을 한 번씩 돌렸습니다.
  • 갈린 지점은 고급 힌트 통제와 종료 절차 두 가지였습니다. 다만 다시 돌려 보니 힌트 항목은 솔라가 틀만 주고 GPT-5.1이 문장을 주는 반대 결과가 나왔습니다. 한 번의 테스트로 모델을 판정할 수 없다는 증거입니다.
  • 같은 프롬프트를 두 모델에 그대로 넣는 비교는 성능을 대변하지 못합니다. 프롬프트는 모델마다 더 잘 먹는 방식이 따로 있기 때문입니다.
  • 수업에서 쓸 만한가라는 기준에서는 솔라 프로 4도 사실상 같은 수준의 만족도를 보였습니다.
  • 속도와 출력 형식, 존댓말 기본값은 솔라 프로 4가 나았습니다. 수업에서 작지 않은 항목들입니다.
  • 두 모델이 똑같이 틀린 대목은 모델이 아니라 제 프롬프트의 빈칸이었습니다.
  • 모델을 바꿀 때는 위 일곱 가지를 확인하시면 됩니다. 그대로 가져다 쓰셔도 좋습니다.

이 글은 개인 테스트 기록이며, 울산광역시교육청이나 우리아이(AI)의 공식 입장이 아닙니다. 모델 선정은 별도의 절차로 결정됩니다.

📖 더 깊은 이야기는 책에서: 『AI 플랫폼 학교를 바꾸다』(테크빌교육) | YES24에서 판매 중

#AI교육 #에듀테크 #우리아이AI #솔라 #업스테이지 #GPT5 #토론수업 #프롬프트 #AI플랫폼학교를바꾸다