• AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
STORIUM
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
STORIUM
No Result
View All Result

부탄 종카어 다음 단어 예측, GRU 정확도 74.03% 기록

유지율 리포터 작성: 유지율 리포터
2026년 07월 15일 14시 28분
Reading Time: 2 mins read
A A
Home AI 모델·연구
Share on FacebookShare on Twitter

부탄 왕립대학교 과학기술대학 연구진이 종카어 입력을 돕는 다음 단어 예측 시스템을 만들었다. 종카어는 한 음절을 입력하는 데 여러 키 조작이 필요해 문서 작성 시간이 길다는 문제의식에서 출발했다. 연구진은 사용자가 앞부분을 입력하면 가능한 다음 단어 목록을 보여주는 웹 애플리케이션을 목표로 LSTM, 양방향 LSTM, GRU 세 순환신경망을 비교했다.

말뭉치는 DCDD에서 확보한 종카어 10만 문장으로, 논문 표에는 단어 1,331,282개, 고유 단어 28,344개, 생성 시퀀스 623,820개가 적혀 있다. 영숫자와 일부 특수기호, 종카어 구두점을 제거한 뒤 TensorFlow 토크나이저로 각 단어에 정수 ID를 붙였다. 이어 N-그램을 만들어 마지막 토큰을 정답 Y, 앞선 토큰을 입력 X로 삼았다. 대다수 문장에 맞춰 최대 길이를 22로 정하고 앞쪽을 0으로 패딩했다.

종카어 다음 단어 예측 LSTM과 GRU의 학습 정확도 및 손실 곡선
10만 문장 실험에서 제시된 LSTM 정확도와 GRU 정확도·손실 학습 곡선. 출처: 원문

모델은 임베딩과 순환층, 완전연결층, 어휘 크기의 소프트맥스 출력으로 구성됐다. 본문의 GRU 설명은 첫 순환층 512유닛과 두 번째 256유닛을 제시하지만, 결과 절은 세 모델 비교 조건으로 200에폭, 순환층 2개, 뉴런 1024·512, 배치 500, 조기 종료 10, 드롭아웃 0.2를 적었다. 손실은 희소 범주형 교차엔트로피를 사용했고, 에폭·배치·검증 분할과 층 크기 등을 조정했다고 설명한다.

10만 문장 비교표에서 LSTM은 8시간에 정확도 60%, 양방향 LSTM은 13시간에 70.79%, GRU는 15.33시간에 74.03%를 기록했다. 연구진은 GRU가 가장 높은 정확도를 보여 웹 앱에 통합했다고 보고했다. 프런트엔드는 HTML·CSS·자바스크립트와 Bootstrap, 백엔드는 Django, 데이터베이스는 SQLite를 사용했고 모델 훈련은 Google Colab에서 수행했다.

작은 2만 문장 실험에서는 LSTM 73.79%, 양방향 LSTM 71.14%, GRU 70.04%였으나 연구진은 과적합이 있었다고 썼다. 데이터 확대와 하이퍼파라미터 조정 뒤에는 GRU가 74.03%로 올라 과적합을 해결했다고 주장한다. 그러나 Figure 5–7의 곡선과 표의 정확도 관계가 명확히 설명되지 않고, 훈련·검증·시험 데이터 분할 비율과 독립 시험셋 구성도 제시되지 않아 이 주장을 수치만으로 확정하기 어렵다.

항목 값 원문 근거
말뭉치 규모 100,000문장 / 1,331,282단어 PDF p.3, Table 2; p.5, Table 3
어휘·시퀀스 28,344 고유 단어 / 623,820 시퀀스 PDF p.3, Table 2
LSTM 8시간 / 60% PDF p.5, Table 4
Bi-LSTM 13시간 / 70.79% PDF p.5, Table 4
GRU 15.33시간 / 74.03% PDF p.5, Table 4

자료: STORIUM 정리

이 연구는 대규모 언어모델보다 단순한 순환신경망으로 저자원 언어 입력 도구를 구현한 사례라는 의미가 있다. 반면 키 입력 감소율, 추천 상위 k개의 적중률, 실제 사용자 타이핑 속도는 측정하지 않았다. 다른 말뭉치나 방언으로의 일반화, 오탈자 처리, 어휘 밖 단어 평가도 없다. 2026년 7월 공개된 arXiv 프리프린트이므로 74.03%는 논문이 정의한 내부 정확도이며, 현장 성능으로 일반화하려면 재현과 사용자 평가가 필요하다.

1차 출처: https://arxiv.org/abs/2607.11515

저작권자 © STORIUM 무단전재 및 재배포 금지

유지율 리포터

유지율 리포터

안녕하세요, 유지율 리포터입니다. arXiv와 학회에서 쏟아지는 AI 연구를 살펴, 논문 속 성과를 과장 없이 우리말로 풀어 드립니다. 사실관계는 발행 전 편집인이 함께 확인합니다.

관련 기사

한국기술교육대학교 산학협력관 자료사진
AI 서비스·툴

고용부·한기대, 무료 AI·AI+X 온라인 과정 24개 공개

2026년 07월 29일 16시 05분
성균관대학교 수원캠퍼스 제2공학관 자료사진
반도체·인프라

수원·성균관대, 양자·AI 반도체 패키징 검증 인프라 구축

2026년 07월 29일 15시 21분
정부세종청사 교육부 청사 자료사진
정책·윤리

교육부, 태국 등 3개국에 한국 AI 교육혁신 사례 공유

2026년 07월 29일 14시 37분
창원특례시청 청사 자료사진
산업 적용

창원시, AI 영어회화 e-러닝 시민 400명 모집

2026년 07월 29일 13시 55분
Next Post
앤트로픽 공식 로고

앤트로픽, 미국 K-12 교사에 ‘Claude for Teachers’ 1년 무료 제공

답글 남기기 응답 취소

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

  • 인기 급상승
  • 최신
Close-up of a GeForce RTX graphics card on a desk, showcasing its design and technology.

엔비디아 RTX 스파크 가격, 최소 2000달러 전망…윈도 노트북 ‘M1 모먼트’ 걸림돌

2026년 06월 02일 11시 19분
A 3D rendering of a neural network with abstract neuron connections in soft colors.

퍼플렉시티, 로컬·클라우드 AI를 자동 판단하는 하이브리드 추론 시스템 발표

2026년 06월 04일 08시 53분
Contemporary building with a glass facade and geometric patterns, low angle view.

앤트로픽·네이버 개발자 밋업 개최…서울 오피스 개소 앞두고 본사 임원 참석

2026년 06월 06일 21시 12분
책상에서 법률 문서에 서명하는 모습

클로드 ‘드리밍’ 기능 공개…앤트로픽, 법률·의료 AI 성능 대폭 향상

2026년 05월 30일 21시 11분
Close-up of a wooden gavel on a judge's desk, symbolizing justice.

AI 생성 성인 콘텐츠 유료 판매 운영자들, 법원서 잇달아 징역형

2026년 06월 05일 22시 40분
한국기술교육대학교 산학협력관 자료사진

고용부·한기대, 무료 AI·AI+X 온라인 과정 24개 공개

2026년 07월 29일 16시 05분
성균관대학교 수원캠퍼스 제2공학관 자료사진

수원·성균관대, 양자·AI 반도체 패키징 검증 인프라 구축

2026년 07월 29일 15시 21분
정부세종청사 교육부 청사 자료사진

교육부, 태국 등 3개국에 한국 AI 교육혁신 사례 공유

2026년 07월 29일 14시 37분
창원특례시청 청사 자료사진

창원시, AI 영어회화 e-러닝 시민 400명 모집

2026년 07월 29일 13시 55분
엔비디아 H100 GPU 노드로 구성된 TSUBAME 4.0 슈퍼컴퓨터 랙

칭화대·Z.ai IndexCache, H100 20만 토큰 실험서 프리필 1.82배 가속

2026년 07월 29일 13시 24분

검색

No Result
View All Result

인기 태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

카테고리

  • AI 모델·연구 (1,486)
  • AI 서비스·툴 (830)
  • 반도체·인프라 (540)
  • 빅테크·기업 (568)
  • 산업 적용 (420)
  • 스타트업·투자 (251)
  • 정책·윤리 (459)

STORIUM은 트렌드와 인사이트를 전하는 종합 뉴스 매체입니다. 정확성, 균형, 맥락의 편집 원칙으로 신뢰받는 뉴스를 전합니다.

카테고리

  • AI 모델·연구
  • AI 서비스·툴
  • 반도체·인프라
  • 빅테크·기업
  • 산업 적용
  • 스타트업·투자
  • 정책·윤리

태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

최근 뉴스

한국기술교육대학교 산학협력관 자료사진

고용부·한기대, 무료 AI·AI+X 온라인 과정 24개 공개

2026년 07월 29일 16시 05분
성균관대학교 수원캠퍼스 제2공학관 자료사진

수원·성균관대, 양자·AI 반도체 패키징 검증 인프라 구축

2026년 07월 29일 15시 21분
  • 소개
  • 문의
  • 광고문의
  • 개인정보처리방침
  • 이용약관
  • 청소년보호정책
  • 정정·반론 보도 안내
  • 편집·윤리강령

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.

No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.