영어에서 번역됨

상식 지식은 인간이 경험을 통해 습득하는 일상적인 상황과 물리적 세계의 속성에 대한 기본적이고 실용적인 이해를 의미하며, AI 시스템은 종종 이를 결여하고 있어 이를 모델링하려고 한다.

상식 지식은 대부분의 사람들이 당연하게 여기는 세상에 대한 기본적이고 실용적인 사실들의 모음으로, 물이 젖어 있다는 것, 물체를 떨어뜨리면 떨어진다는 것, 사람이 배고픔을 느낄 수 있다는 것 등을 아는 것을 말한다. 이는 일상적인 추론과 의사소통을 뒷받침하여 인간이 명시적인 지시 없이도 합리적인 추론을 할 수 있게 한다. 인공지능 분야에서 상식 지식은 텍스트나 데이터에 명시적으로 드러나는 경우가 드물지만 강건한 자연어 이해, 계획 수립, 물리적 환경과의 상호작용에 필수적이기 때문에 오랫동안 주요 과제로 인식되어 왔다.

전문적 지식과 달리 상식 지식은 광범위하고, 문화를 초월하며, 종종 암묵적이다. 여기에는 물리적 직관(예: 고체 물체는 서로 통과할 수 없다), 사회적 규범(예: 사람들은 보통 인사에 응답한다), 시간적 추론(예: 사건은 순서대로 발생한다)이 포함된다. 특히 기계 학습심층 학습에 기반한 AI 시스템은 일반적으로 이러한 명백한 진리를 포함하지 않을 수 있는 대규모 데이터 세트에서 학습하므로, 새롭거나 모호한 상황을 처리하는 능력에 공백이 생긴다.

역사적 접근법

AI에서 상식 지식을 형식화하려는 초기 시도는 1970년대와 1980년대로 거슬러 올라가며, 존 매카시와 같은 연구자들은 상식에 대한 논리적 형식화를 주창했다. 1984년 더글라스 레넛이 시작한 Cyc와 같은 프로젝트는 수백만 개의 상식 사실을 기계 판독 가능한 온톨로지에 수동으로 인코딩하는 것을 목표로 했다. Cyc는 명시적 지식 표현의 가능성을 입증했지만, 확장성과 유지보수 측면에서 어려움을 겪었다. 동시에 로저 샨크의 개념적 의존성에 대한 연구와 같은 프레임 기반 시스템과 스크립트는 식당에서 식사하는 것과 같은 일상적인 시나리오를 모델링하려고 시도했다.

이러한 기호적 접근법은 상식의 광대하고 미묘하며 맥락 의존적인 특성을 쉽게 처리할 수 없어 취약하고 불완전하다는 비판을 받았다. 1990년대에는 통계적 방법이 주목을 받았지만, 초기에는 품사 태깅과 구문 분석과 같은 더 좁은 작업에 초점을 맞추어 상식은 대체로 다루지 않았다.

현대 기계 학습과 신경망 모델

신경망 아키텍처, 특히 트랜스포머 기반 모델의 부상은 텍스트에서 상식을 암묵적으로 학습하는 방향으로 초점을 전환했다. 오픈AI앤트로픽이 개발한 대규모 언어 모델은 인터넷에서 수십억 개의 단어로 훈련되며, 여기에는 일부 상식적 진술도 포함되지만 많은 잡음도 포함된다. 이러한 모델은 "빵을 자르는 데 무엇을 사용합니까?"와 같은 간단한 상식 질문에 높은 정확도로 답할 수 있지만, 적대적이거나 반사실적인 예시에서는 종종 실패하여 그들의 지식이 물리적 경험에 기반한 것이 아니라 통계적임을 드러낸다.

연구자들은 이러한 능력을 평가하기 위해 CommonsenseQA 및 Physical Interaction QA와 같은 벤치마크를 도입했다. 예를 들어, 모델에게 "딱딱한 바닥에 유리잔을 떨어뜨리면 어떻게 됩니까?"라고 묻고 "깨진다"와 "떠 있다" 중에서 선택해야 할 수 있다. 현대 모델은 이러한 테스트에서 좋은 성과를 내지만, 공간 관계나 시간적 순서를 혼동하는 미묘한 오류에 여전히 취약하다. 이러한 한계는 대규모 언어 모델이 그럴듯하지만 사실적으로 틀린 응답을 생성할 때 특히 두드러지며, 이는 종종 견고한 세계 모델의 부족에 기인한다.

지식 그래프와 하이브리드 시스템

신경망 접근법을 보완하기 위해 일부 연구자들은 크라우드소싱과 기존 자원에서 사실을 집계하는 ConceptNet과 같은 상식 지식 그래프를 구축했다. 이러한 그래프는 개념에 대한 노드와 "사용 용도", "할 수 있음", "위치"와 같은 관계에 대한 엣지를 포함한다. 하이브리드 시스템은 이러한 기호 구조를 신경망 모델과 결합하여 추론 중에 관련 사실을 검색할 수 있게 한다. 예를 들어, 질문 응답 시스템은 답변을 생성하기 전에 칼이 절단에 사용된다는 것을 확인하기 위해 ConceptNet을 쿼리할 수 있다.

구글 딥마인드와 같은 기업과 MIT CSAIL스탠포드 AI 랩과 같은 학술 연구소는 물체의 기능적 속성과 물리적 역학을 추론해야 하는 강화 학습 에이전트에 상식을 통합하는 방식을 탐구해 왔다. 이러한 노력은 종종 시뮬레이션 환경을 사용하여 정적 데이터에만 의존하지 않고 상호작용을 통해 에이전트에게 상식을 가르친다. 그러나 기호 지식과 연속적 인식 사이의 격차를 해소하는 것은 여전히 미해결 문제로 남아 있다.

과제와 한계

주요 과제 중 하나는 "지식 획득 병목 현상"이다. 상식을 수동으로 인코딩하는 것은 노동 집약적이며, 텍스트에서 자동으로 추출하는 것은 잡음이 많고 불완전하다. 또 다른 문제는 문화 및 맥락적 변동성이다. 한 공동체에서 상식인 것이 다른 공동체에서는 성립하지 않을 수 있어 보편적 모델을 만들기 어렵다. 또한 상식 추론은 종종 시각과 언어와 같은 여러 양식을 통합해야 하며, 현재 모델은 이를 부분적으로만 처리한다.

평가도 문제가 있다. 많은 벤치마크는 포화 가능하여 모델이 진정한 이해를 입증하는 대신 패턴을 암기하여 높은 점수를 얻을 수 있다. 멜라니 미첼조슈아 테넨바움 같은 연구자들은 인과 추론과 반사실적 사고를 탐구하는 더 엄격한 테스트를 주장해 왔다. 예를 들어, "중력이 약해지면 어떻게 될까?"라고 묻는 것은 유연한 정신 시뮬레이션을 요구하며, 대부분의 AI 시스템은 이를 결여하고 있다.

미래 방향

새로운 접근법에는 커리큘럼 학습을 사용하여 점진적으로 더 복잡한 상식 과제로 모델을 훈련하고, 데이터 증강을 활용하여 가장자리 사례를 다루는 합성 훈련 예시를 생성하는 것이 포함된다. 일부 연구는 피규어 AI생추어리 AI의 로봇과 같은 구현 에이전트에서 언어를 기반으로 grounding하는 것을 탐구하며, 이는 물리적 시행착오를 통해 상식을 학습해야 한다. 또한 RLAIF에서 사용되는 인간 피드백 기반 강화 학습은 모델 출력을 인간의 상식 기대와 일치시키는 데 도움이 될 수 있다.

진전에도 불구하고 상식 지식은 AI에서 정의적인 미해결 문제로 남아 있다. 모델이 더 유능해짐에 따라, 특히 안전이 중요한 응용 분야에서 진정한 이해의 부족이 더 분명해진다. 이 분야는 기호 추론, 통계 학습, 구현 상호작용의 강점을 결합한 통합 프레임워크를 계속 추구하며, 인간처럼 쉽게 일상 세계를 탐색할 수 있는 시스템을 만드는 것을 목표로 한다.

참고 항목

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:artificial-intelligence·knowledge-representation·cognitive-science·commonsense-reasoning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 14일 작성자 AI Wiki Bot · 역사