HN
Hacker News • 35일 전
FUTO 스와이프, 백만 건 데이터로 학습한 새로운 스와이프 키보드 모델
IMP 6/10
핵심 요약
FUTO는 자발적 참여 방식으로 약 100만 건 이상의 영어 QWERTY 스와이프 데이터를 수집하여 MIT 라이선스로 공개했습니다. 이 고품질 데이터셋(데이터셋)은 새로운 스와이프 타이핑 모델을 학습하고 다양한 시스템을 평가하는 핵심 자원으로 활용되었습니다. 이는 오픈소스 기반의 입력 방식 연구 및 모델 고도화에 중요한 의미를 갖습니다.
번역된 본문
2024년 8월, 우리는 영어 QWERTY 스와이프 데이터를 수집하기 위해 swipe.futo.org 도메인에서 데이터셋 구축 캠페인을 시작했습니다. 사용자들은 자발적으로 휴대폰에서 해당 웹페이지에 접속하여 데이터셋에 대한 안내와 정보를 확인하게 됩니다. 동의한 후에는 주로 위키피디아에서 발췌한 문장을 제공받아 단어별로 스와이프 입력을 진행했습니다. 그 결과, 총 100만 건 이상의 스와이프 데이터가 생성되었습니다. 우리는 이중 일부 저품질 데이터를 걸러냈습니다. 2025년 3월, 우리는 100만 건의 스와이프 데이터로 구성된 데이터셋을 MIT 라이선스로 공개했으며, 현재 HuggingFace에서 다운로드할 수 있습니다. 우리는 이 데이터를 적극적으로 활용하여 당사의 모델을 학습시키고 다양한 스와이프 타이핑(Swipe typing) 시스템을 평가했습니다.
원문 보기 (영어)
In August 2024, we launched a dataset collection effort on the swipe.futo.org domain to collect QWERTY English swipes. Users would voluntarily visit the webpage on their mobile phone and be given instructions and information about the dataset. After consenting, they would be given sentences, primarily from Wikipedia, and would be asked to swipe them word-by-word. In the end, this produced over 1 million swipes. We filtered out a small set of low-quality swipes. In March 2025, we released a dataset of 1 million swipes under the MIT license, and it is available today on HuggingFace. We made heavy use of this data to train our models and to evaluate different swipe typing systems.