학생은 튜터를 설계자 뜻대로 안 쓴다 — 교육 AI를 평가 방법론으로 다시 읽기
만족도·engagement로 교육 AI를 평가하면 실제 학습 목표를 못 봅니다. ACL 2026 논문의 여섯 지표와 turn별 측정을 eval 방법론 관점에서 뜯어봤습니다.
POSTECH · PIAI
Multi-agent systems & human-centered AI
멀티에이전트와 에이전트 평가를 연구합니다. 논문에서 주장하는 게 실제로 동작하는지 코드로 직접 확인하고, 되는 건 블로그에, 코드는 GitHub에 남깁니다.
만족도·engagement로 교육 AI를 평가하면 실제 학습 목표를 못 봅니다. ACL 2026 논문의 여섯 지표와 turn별 측정을 eval 방법론 관점에서 뜯어봤습니다.
sympo의 PRD→WBS 파이프라인에서 검증 게이트, 평가 환경, LLM-as-judge를 함께 설계하는 기준을 정리합니다.
GPT-5.6은 Sol·Terra·Luna 세 등급으로 나뉩니다. sympo에서는 모델 라우팅보다 programmatic tool calling의 관측 가능성이 먼저 검증할 항목입니다.