EVERY WORD HAS A SOURCE
단어 뒤에 있는, 실제 자료.
원문과 계산 방법을 열어두고, 제공된 정보의 범위에서 보여드립니다.
한국어 위키낱말사전
68,222개 표제어 · 72,569개 항목. 뜻풀이·예문·발음·어원과 원문에 명시된 관계를 검색합니다.
Wiktionary contributors · CC BY-SA 4.0
Kaikki.org에서 추출한 한국어판 원문을 NFC 정규화하고 검색용 인덱스를 추가했습니다. 원문에 없는 유의어나 감정 점수는 만들지 않습니다. 용법과 유래가 미분류된 단어는 그대로 남겨둡니다.
한국어기초사전
국립국어원 · 2026년 9월 19일 공개 파일 · 53,671개 항목.
CC BY-SA 2.0 KR. 텍스트 자료만 사용합니다.
실제 초·중·고급 어휘 등급, 의미 및 상황 분류, 뜻과 예문을 보존합니다. 위키낱말사전의 같은 표제어와 의미를 임의로 합치지 않습니다. ‘대화’로 표시된 예문은 저자가 구성한 대화이며, 실제 일상 대화를 녹음한 자료는 아닙니다.
UD Korean KAIST
KAIST 및 Universal Dependencies 기여자 · CC BY-SA 4.0.
뉴스·소설·학술 자료가 섞인 말뭉치입니다. 수동 주석에서 변환된 형태소·품사·의존 관계를 사용하며 별도의 형태 분석 모델을 실행하지 않습니다.
고정 품사 규칙으로 내용 형태소를 이어붙이고 서술어에 ‘다’를 붙여 검색 기본형을 만듭니다. 결합어는 직접 의존 관계로 연결된 두 표현의 수입니다. 관계 유형과 원문 형태소를 함께 표시합니다.
MOT · VOA 한국어 뉴스
Brandeis University BLT Lab · Chester Palen-Michel, June Kim, Constantine Lignos. MOT v1.11 수록 자료 중 실제 발행일이 있는 기사 134,266개.
MOT 자료집: CC BY 4.0. 제공자는 원본 VOA 텍스트를 public domain으로 명시합니다.
오디오·영상 설명은 제외하고, 본문이 완전히 같은 기사는 한 번만 셉니다. 실제 발행 연도를 사용하며, 다운로드·추출 연도를 발행 연도로 바꾸지 않습니다. 모델이 예측한 언어 필드는 사용하지 않습니다.
빈도를 읽는 방법
입력한 문자열이 본문에 나타난 겹치지 않는 출현 횟수를 셉니다. 띄어쓰기와 활용형이 다른 표현은 합치지 않습니다. 분모는 한글·라틴 문자·숫자가 이어진 구간의 전체 수이며, ‘백만 어절당 빈도 = 출현 횟수 ÷ 전체 어절 수 × 1,000,000’으로 계산합니다.
자료의 분야, 작성 목적, 연도별 수록량이 다릅니다. 특히 기초사전 대화 예문과 VOA 뉴스의 차이를 한국어 전체의 구어·문어 차이로 일반화할 수 없습니다. 수치가 높다고 더 좋은 표현인 것은 아닙니다.