2026 한국언어청각임상학회 학술대회 · 기조강연

비정형 한국어 음성의
모바일–웹 통합 수집 플랫폼 개발과 다학제적 분석

학술대회 주제 “포괄적 의사소통과 기술 혁신”

윤태진

성신여자대학교 · tyoon@sungshin.ac.kr

강남대학교
2026. 9. 12.(토) 10:30–11:20

SPEAKER

발표자 소개 — 저는 언어학자입니다

윤태진

Tae-Jin Yoon

성신여자대학교 영어영문학과 교수 · 창의융합대학 학장

Ph.D. Linguistics, University of Illinois at Urbana-Champaign (2007)

학위논문 「문법 접면을 통한 운율 예측 모형」 (Predictive Model of Prosody through Grammatical Interface: A Computational Approach)

믿음

음성학 · 음운론

말소리에는 규칙·제약·패턴이 있다는 확신

운율을 발화 조직의 구조로 보는 관점

대규모 음성 코퍼스 기반 말소리 분석

도구

음성공학 · AI

한국어 강제정렬기(Korean Forced Aligner) 개발

HMM·SVM 기계학습, Wav2Vec 2.0 딥러닝 활용 연구

웹 기반 음성 분석·인식·지각 서비스 구현과 연구 활용

동료

다학제 협업

하승희(한림대)·소정민(서강대)과 아동 발화 연구 (2021-2024)

윤지혜·한우재·이승진(한림대) 합류 — 비정형 화자 (2025–2028)

그 흐름 위에서 수집 플랫폼 개발 진행 중

관점 저는 임상가가 아닙니다 — 오늘 말씀드리는 것은 한 언어학자의 연구가 임상과 만나 온 여정입니다.

2026 한국언어청각임상학회 학술대회 · 기조강연

2

AGENDA

오늘의 이야기 — 한 연구 여정의 네 단계

Part 1

출발점

규칙·제약·패턴,
그리고 도구

6분

Part 2

다학제의 시작

아동 발화 연구
(하승희·소정민)

9분

Part 3

확장

팀의 확장과
수집 플랫폼

13분

Part 4

활용

전생애 사례와
다학제 협업

12분

사례를 관통하는 축 — 전생애(lifespan): 영유아에서 노년·임상까지

영유아

아동

노년

청각임상

ASR·음운론

2026 한국언어청각임상학회 학술대회 · 기조강연

3

여는 질문

우리가 만드는 음성 기술은
누구의 목소리로 학습되었는가?

20~50대

정상 청력

표준어

조용한 스튜디오

— 대부분의 대규모 음성 데이터가 그려 온 ‘평균적 화자’

2026 한국언어청각임상학회 학술대회 · 기조강연

4

THESIS

이 강연의 제안

“비정형 음성 데이터를 모으는 인프라가
포괄적 의사소통을 향한 기술 혁신의 한 출발점이 될 수 있다.”

1

규칙 Rules

말소리에는 언어학적 규칙·제약·패턴이
있다 — 비정형 발화에서도 상당 부분
관찰되며, 해석의 유용한 출발점이 된다.

2

도구 Tools

그 규칙은 대규모 실제 발화에서
더 온전히 드러난다 — 음성공학·AI는
그것을 들여다보는 현미경이다.

3

동료 Team

비정형 화자의 음성은 언어학·공학·
임상이 함께할 때 더 잘 모으고,
더 깊이 해석할 수 있다.

2026 한국언어청각임상학회 학술대회 · 기조강연

5

Part 1

출발점 — 말소리에는 문법이 있다

언어학적 규칙·제약·패턴, 그리고 그것을 보는 도구

2026 한국언어청각임상학회 학술대회 · 기조강연

6

PART 1 · 언어학

말소리의 이중성 — 연속적 신호와 범주적 지식

음성학 Phonetics

물리적 · 연속적

파형·포먼트·지속시간 — 끊김 없이 변하는 물리량

화자마다, 발화마다 다른 무한한 변이

측정과 계측의 세계

음운론 Phonology

추상적 · 범주적

‘불·뿔·풀’ — 삼지적 대립을 가르는 지식

변이 속에서도 유지되는 대립·규칙·제약

범주와 문법의 세계

불 · 뿔 · 풀

이 이분법을 대규모 실제 발화 데이터가 다시 잇고 있다 — 그리고 그 접점에 임상 음성이 있다.

핵심 임상 평가란 연속적 신호에서 범주적 판단을 내리는 일 — 언어학이 백 년간 해 온 바로 그 작업이다.

2026 한국언어청각임상학회 학술대회 · 기조강연

7

PART 1 · 언어학

규칙 · 제약 · 패턴 — 대규모 데이터에서 확인한 것들

음변화 · 모음

장단 대립의 병합

서울말 ‘눈(雪)–눈(眼)’류 모음 장단
대립이 세대에 걸쳐 소멸하는 과정을
수백 명 규모 발화로 추적.

Kang, Yoon & Han (2015) Laboratory Phonology

음변화 · 자음

어두 폐쇄음 VOT 변화

평음–기식음 VOT 축소가 출생연도와
단어 빈도에 따라 진행 — 개인·어휘
층위까지 내려가는 체계적 패턴.

Bang et al. (2018) Journal of Phonetics

운율

운율 구조의 예측

통사·의미 정보로 운율 경계를 예측하는
모형 — 운율은 장식이 아니라 발화를
조직하는 문법이다.

Yoon (2007) Ph.D. dissertation, UIUC

핵심 이런 패턴은 소수 화자의 실험 데이터보다 수백~수천 명의 실제 발화에서 훨씬 온전히 드러난다.

2026 한국언어청각임상학회 학술대회 · 기조강연

8

PART 1 · 언어학

도구를 만들다 — 한국어 강제정렬기(Korean Forced Aligner)

발음사전

어휘·발음형
· OOV 처리

자소–음소 변환

한글 → 음소열
유니코드 처리

음운규칙 적용

연음·동화·탈락
표면형 도출

HMM 음향모델

화자 80명
약 100시간 학습

음소·단어 경계

TextGrid 출력
(수동 검수 병행)

왜 만들었는가 — 시간을 연구로

음소·단어 경계의 수작업 정렬은 방대한 시간을 소모

낭독체 문장부터 자동화 — 정렬 시간을 분석·해석 연구로

연음·동화·탈락 등 음운규칙을 아는 정렬기로 설계

무엇으로 이어졌는가

낭독체 대규모 코퍼스의 자동 음향 측정 (수십만 어절)

자연·아동 발화는 아직 한계 — 수동 검수 병행, 협업의 필요

웹 서비스로 공개 — 한국어 강제음성정렬: http://210.125.93.241:5010

핵심 공학은 목적이 아니라 현미경이다 — 언어학적 규칙을 보기 위해 도구를 만들었다.

2026 한국언어청각임상학회 학술대회 · 기조강연

9

Part 2

다학제의 시작 — 아동 발화

말소리 습득의 현장에서 언어병리학·공학을 만나다

윤태진

성신여대 — 음성학 · 음운론, 음성공학

+

하승희

한림대 언어병리학 — 아동 말·언어 발달

+

소정민

서강대 — 컴퓨터공학 · 음성인식

이 협업이 밝힌 것 — 사례 셋

아동 · 분절음

어두 폐쇄음
3중 대립의 습득

아동 · 운율

강세구(AP) 성조
패턴의 발달

영유아

양육자 말 레지스터
(가정 종일 녹음)

2026 한국언어청각임상학회 학술대회 · 기조강연

10

PART 2 · 사례 ①

아동 — 어두 폐쇄음 3중 대립의 발달 경로

아동

한국어 단일어 아동 35명(1;6~2;6) vs 성인 10명 · VOT·F0·H1–H2

질문: 전사로는 ‘오류’인 시기 — 음향적으로는 이미 대립을 만들고 있는가? (covert contrast)

VOT(시간 단서)는 벌써 안정 — 경음 최단·기식음 최장, 아동·성인 간 차이 없음

F0·H1–H2(주파수 단서)는 발달 중 — 성인과 반대 방향의 F0 패턴, 기식음에서 연령차 최대

판별분석: 경음 64% > 평음 57% > 기식음 41% — 기식–평음 음향 중첩

Yoon, Kwon, So & Ha (2026). First Language, 46(1), 147–171. (SSCI)

아동의 음향 공간 (모식도)

경음
/ㄲ ㄸ ㅃ/

기식음

평음

중첩

분리 ✓

임상 포인트 시간 단서(VOT)는 먼저, 주파수 단서(F0·H1–H2)는 나중 — 2세 전후 기식–평음 혼동은 예측 가능한 발달 지점.

2026 한국언어청각임상학회 학술대회 · 기조강연

11

PART 2 · 사례 ②

아동 — 강세구(AP) 성조 패턴의 습득

아동

AI Hub 아동 코퍼스 3~10세 · ‘거북이는’ 487토큰

배경: 성인 서울말은 음변화 진행 중 — 평음·기식음 VOT 병합, F0가 대립을 인수 (tonogenesis)

질문: 입력이 흔들리는 동안 아동은 표면 음성을 복사하는가, 추상적 음운을 추출하는가?

전 연령에서 LHLH 실현 — 성장곡선분석 3차항 유의, 연령 간 곡선형 차이 없음

아동 VOT 68.5ms = 현대 성인 수준 (과거 규범 42ms 아님) — 최신 음성 체계를 반영

그러나 VOT는 F0를 예측 못함 — L→H +4.67반음 상승 유지 → 성조형은 음운적으로 부호화

Yoon, Ha & So (2022) Speech Prosody · 확장 논문 학술지 투고 중

연령별 F0 곡선 (세미톤) — 관찰된 LHLH

‘거북이는’ — 3~10세 8개 연령 패널 중 7개에서 L–H–L–H (8세만 예외)

임상 포인트 성조형은 3세에 이미 음운적으로 부호화 — 운율 규준의 토대. 그러나 임상 집단은 공개 데이터에 없다.

2026 한국언어청각임상학회 학술대회 · 기조강연

12

PART 2 · 사례 ③

영유아 — 가정 종일 녹음이 밝힌 것

영유아

모–영아 종일 가정 녹음 — 28쌍 4~21개월(149회) · 11쌍 9~12개월

왜: 영아어(IDS)는 균질한 한 말투가 아니다 — ‘베이비 레지스터(BR)’와 성인형 레지스터의 혼합

왜: 실험실 단기 녹음과 평균 비교로는 총량에 가려진 구성, 평균에 가려진 분포를 볼 수 없다

IDS 총량은 4~21개월 내내 무추세(BF10=0.03) — 그러나 BR 비중은 7개월 이후 낮아짐 (91.7→86.5%)

점진적 감소가 아니라 7개월 전후의 계단식 변화가 우세 (ΔBIC=−2.69) — 작은 효과, 탐색적

음향(11쌍): IDS는 F0·HNR↑, 발화 길이↓ — 그러나 분포는 ADS와 크게 중첩, 대부분 단봉 → 연속적 조정

베이비 레지스터 비중 — 선형 vs 7개월 계단 모형

종일 녹음 149회의 BR 비중 — 계단 모형이 근소하게 우세 (탐색적)

한계: 지각 코딩의 연령 기대 효과 분리 불가 (저자 명시) · 출처: Infancy (수정 중) · First Language (FLA-26-0074, 수정본)

임상 포인트 ‘말을 많이 하라’는 양적 조언을 넘어 무엇이 어떻게 변하는지가 중요 — 그 판별에는 자연스러운 일상 녹음 인프라가 필요하다.

2026 한국언어청각임상학회 학술대회 · 기조강연

13

PART 2 · 전환

아동에서 특수 화자로 — 두 개의 공동연구 과제

2021–2024 · 일반공동연구

아동 말 데이터베이스 · ASR 말소리 평가

하승희(연구책임) · 윤태진 · 소정민

임상 현실: 말소리 평가는 청지각 판단 의존 — 객관성·시간·비용의 한계로 조기 선별이 어렵다

기술 현실: 7세 이하 아동의 음성인식 정확도 약 60% (성인 94%)

그래서: 일반·말소리장애 아동 3,000명 규모 DB + 아동 특화 발음사전 + ASR 기반 평가 시스템

2025–2028 · 글로벌인문사회융합연구

특수 화자 음성인식 · 의사소통 지원

하승희(연구책임) 외 6인 — 윤지혜·한우재·이승진 합류 · 해외 공동연구(Mark Hasegawa-Johnson, UIUC)

확인한 것: 같은 문제가 특수 화자 전반에 — 아동·노년·언어장애 화자의 ASR 오류율 70~86%

노화·신경퇴행(파킨슨병·노화성 난청)의 명료도 저하, 임상 메타데이터 없는 기존 학습 데이터

그래서: 전문가 주도 수집 + 웹 기반 수집 플랫폼 + 맞춤 ASR(Wav2Vec 2.0 등) + AAC·재활 연계

전환 아동에서 확인한 격차가 특수 화자 전체로 — 이 두 과제의 궤적이 오늘 발표의 3부와 4부다.

2026 한국언어청각임상학회 학술대회 · 기조강연

14

Part 3

비정형 화자로 — 팀의 확장

특수 화자 다학제 과제 (2025–2028) — 첫 과업은 함께 쓰는 데이터 인프라

아동 발화 협업에서

윤태진 — 음성학·음운론

하승희 — 아동 말·언어 (한림대)

소정민 — 컴퓨터공학·음성인식 (서강대)

비정형 화자 다학제 팀으로 — 한림대 언어병리학 3인 합류

윤지혜

신경 말·언어장애

한우재

청각학

이승진

음성장애

발달 + 신경 + 청각 + 음성 — 전생애·전 영역을 덮는 임상 전문성

영유아

아동

노년

청각임상

ASR·음운론

2026 한국언어청각임상학회 학술대회 · 기조강연

15

PART 3 · 데이터 격차

특수 화자 음성 데이터 — ‘있다’와 ‘쓸 수 있다’ 사이

AI Hub에는 특수 화자 데이터가 이미 있다 — 문제는 양이 아니라 임상적 쓸모다.

데이터 (AI Hub)규모 · 내용임상·연구 관점의 한계
한국어 아동 음성무소음·소음 낭독 발화 5,000시간낭독 위주 — 규격화된 다양한 음성 샘플 부재 · 장애 음성 부재 · 메타데이터 부재
자유대화 음성 (노인)60세 이상 남녀 1,000명 · 3,000여 시간전사·언어처리용 — 위와 같은 한계 공유 (임상 메타데이터·장애 음성 부재)
난청 검사 음성난청인 5,080명 포함 15,235명 어음청력검사단어 수준 자료에 국한 · 난청의 정도·종류·패턴에 따른 구분 없음
구음장애 음성인식뇌신경·언어청각·후두장애 1,200명 · 5,000시간+정상 발달의 조음오류·정상 노화의 변이 미반영 · 메타데이터 부재

공통 결핍 (계획서 분석) ① 임상 메타데이터를 갖춘 데이터 부족 ② 병리적 변이를 반영한 정교한 라벨링 부재 ③ 기관별 분산·폐쇄적 접근성

핵심 격차의 본질은 데이터의 존재가 아니라 임상적 쓸모 — 전문가가 설계하고 검증한 데이터가 필요하다.

2026 한국언어청각임상학회 학술대회 · 기조강연

16

PART 3 · 플랫폼

왜 플랫폼인가 — 현장의 세 가지 마찰

1

모집과 현장 운영

통제된 환경, 보호자·기관 조율, 취약집단 특수 동의 절차 — 대상자 한 명을 만나기까지의 비용이 크다.

2

품질 유지의 어려움

제각각인 기기·음향 환경·과제 수행 — 녹음마다 조건이 달라져 데이터 변산이 통제되지 않는다.

3

통합 메타데이터 스키마 부재

연령·녹음 조건·과제 유형이 기록되지 않거나 제각각 — 모아도 나중에 쓸 수 없는 데이터가 된다.

핵심 개별 연구실의 노력만으로는 넘기 어려운 구조적 마찰 — 인프라 차원의 해법이 필요하다.

2026 한국언어청각임상학회 학술대회 · 기조강연

17

PART 3 · 플랫폼

설계 원칙 네 가지

1

통합 생태계

음성 수집·메타데이터 구조화·품질관리·분석 준비를 단일 플랫폼으로 — 도구를 이어 붙이지 않는다.

2

대상자 맞춤 UX

아동·노년·청각임상 세 집단에 최적화된 화면 흐름을 하나의 앱에서 동적 분기.

3

메타데이터 우선

모든 녹음에 참여자·과제·기기·환경 정보가 자동 결합 — 완전한 추적성과 감사 이력.

4

즉시 분석 가능

자동 파이프라인이 ASR(WhisperX)·정렬(MFA) 호환 번들을 산출 — 전처리 부담 최소화.

2026 한국언어청각임상학회 학술대회 · 기조강연

18

PART 3 · 플랫폼

시스템 한눈에

모바일 앱

React Native
(Android)

API 서버

Django REST
인증·업로드·메타데이터

음성 분석·시각화

ASR(Whisper)·음향 분석
백엔드 구현 진행 중

저장소

오디오 파일 +
SQLite 메타데이터

웹 관리 콘솔

QC 대시보드
주석·교정·내보내기

모든 구성요소는 표준 API로 통신 — 모듈 교체·확장이 자유로운 구조

참고 기술 스택 이야기는 이 슬라이드가 처음이자 마지막입니다 — 이후는 ‘무엇을 할 수 있는가’로 말씀드립니다.

2026 한국언어청각임상학회 학술대회 · 기조강연

19

PART 3 · 플랫폼

대상자별 라우팅 — 한 앱, 세 가지 경험

아동

발달 음성

큰 터치 영역·단순한 2단계 흐름

그림 자극으로 주의 유지

짧은 과제 단위로 분할

노년

노화 음성

고대비 화면·큰 활자

단계별 명확한 지시문

피로를 고려한 진행 속도·휴식

청각·임상

공동 설계 중

어음청각검사(KSA) — 단음절·문장 따라말하기

표준화 녹음 자극 · 쾌적 강도(MCL) 제시

반응 녹음 저장 → 전사 기반 재채점 지원

공통 UX 마이크 점검 · 프롬프트 미리보기 · 재시도 로직 · 이어 올리기(resumable upload) — 단일 코드베이스에서 동적 분기

2026 한국언어청각임상학회 학술대회 · 기조강연

20

PART 3 · 플랫폼

수집 워크플로 — 동의에서 서버 확인까지 8단계

01

동의

참여자·보호자
전자 동의

02

프로파일

인구정보 입력
집단 라벨링

03

과제 선택

집단별 과제 세트
자동 라우팅

04

녹음

실시간 파형
·시각 타이머

05

단말 저장

기기 내 암호화
임시 저장

06

업로드

오디오+메타데이터
패키지 전송

07

완료 확인

서버 확인 응답
·실패 시 재시도

핵심 선형·유도형 흐름이 동의부터 서버 동기화까지 데이터 무결성을 보장한다.

2026 한국언어청각임상학회 학술대회 · 기조강연

21

PART 3 · 플랫폼

모바일 앱 실제 화면

① 과제 유형 선택

② 수집 홈

③ 말하기 과제 메뉴

④ 대상자 정보 입력

⑤ 그림 이름대기 (1/30)

핵심 단순함과 충실한 데이터 캡처의 균형 — 현장 연구자가 별도 교육 없이 바로 쓸 수 있는 흐름

2026 한국언어청각임상학회 학술대회 · 기조강연

22

PART 3 · 플랫폼

수집 프로토콜 7종 — 임상 근거 기반 과제

과제내용임상적으로 보는 것
연장 모음 /아/편안한 음도로 모음을 길게 지속최대발성지속시간(MPT) · 호흡 지지 · 발성 안정성
조음교대운동(DDK)/퍼/·/터/·/커/·/퍼터커/ 빠른 반복조음 속도·리듬 · 신경운동 협응(마비말장애·말실행증 선별)
그림 이름대기화면에 제시된 그림의 이름 말하기어휘 인출 · 읽기 부담 없는 단어 수준 조음
문장 읽기짧고 쉬운 문장 낭독읽기 정확도 · 조음 오류 관찰
숫자 세기1~10 자동 발화인지부하 최소의 명료도 기준선 · 다양한 음소 표집
문단 낭독‘가을’ 등 표준 문단 읽기연결발화 흐름 · 운율·호흡군 · 호흡–발성–조음 통합 평가
유도 자발화이야기·그림 설명으로 자연 발화 유도자연 음운변이(동화·탈락) · 실제 운율·구문 다양성

분석·시각화 예 (DDK) http://210.125.93.241:8010/voice-analysis/ddk/ — 구현 중인 백엔드 음성 분석·시각화의 데모

임상 포인트 일곱 과제가 함께 호흡–발성–조음–운율–어휘의 전 층위를 덮는다 — 말·언어 평가 문헌에 근거한 구성.

2026 한국언어청각임상학회 학술대회 · 기조강연

23

PART 3 · 플랫폼

품질관리(QC) — 자동 검사 + 사람의 판단

자동 검사 (업로드 즉시)

파일 무결성 — 포맷(WAV/AAC)·헤더·디코딩 검증

지속시간·휴리스틱 — 무음 비율 90% 초과, 클리핑 피크 플래그

메타데이터 검증 — 필수 항목·논리적 범위 강제

중복 탐지 — 콘텐츠 해시로 중복 제출 자동 거부

수동 검토 큐 (플래그된 녹음)

전문가 청취 — 재생 인터페이스로 명료도 평가

주석 — 배경 소음·중단·지시 불이행 태깅

판정 게이트 — 승인 또는 사유코드와 함께 반려

상태 추적 — 대기 → 검토 완료 → 분석 준비

업로드

자동 QC

수동 검토 큐

분석 준비 완료

핵심 자동화의 효율과 인간 판단의 신뢰를 결합 — 반려 사유가 다시 현장 프로토콜 개선으로 환류된다.

2026 한국언어청각임상학회 학술대회 · 기조강연

24

PART 3 · 플랫폼

보안 · 윤리 · 동의 — 취약집단 데이터의 전제조건

데이터 보호

개인식별정보 최소화 — 식별자와 오디오 분리, 익명 세션 ID

암호화 — 전송 TLS 1.3 · 저장 AES-256, 단말에서 서버까지

역할 기반 접근 제어(RBAC) — 승인된 연구자만 원자료 접근

감사 로그 — 모든 접근·수정 이력 기록, 정기 보안 점검

윤리 · 동의

전자 동의 흐름 내장 — 미성년자는 보호자 동의 필수

IRB 준수 — 인간 대상 연구 지침에 정합한 프로토콜

취약집단 보호 — 연령에 맞춘 쉬운 언어의 설명·강화된 보호

철회권 — 언제든 데이터 삭제를 요청할 수 있는 절차 보장

정합성 개인정보보호법(PIPA)·GDPR 원칙에 맞춘 설계 — 기관·임상 연구에 그대로 탑재 가능한 수준을 목표.

2026 한국언어청각임상학회 학술대회 · 기조강연

25

PART 3 · 플랫폼

최종 산출물 — 분석 준비 완료 번들

AUDIO

16kHz WAV · 잡음 저감

META

참여자·과제·기기 JSON

TEXT

검증 전사 (TextGrid/TXT)

ALIGN

음소·단어 정렬 (MFA)

진행 중

연구자가 받는 것은 파일 더미가 아니라
곧바로 분석 가능한 데이터셋

웹 관리 콘솔 — 메인

통계 대시보드

녹음 상세 — 파형·ASR 전사·수동 교정

2026 한국언어청각임상학회 학술대회 · 기조강연

26

Part 4

플랫폼이 연 질문들 — 전생애 활용 사례

플랫폼 기반 수집 · 오프라인 수집 청각장애 자료의 다학제 분석

2026 한국언어청각임상학회 학술대회 · 기조강연

27

PART 4 · 사례 ④

노년 — 태블릿 가정 녹음으로 본 음성 노화

노년

건강한 50~81세 207명 · 문단 낭독 · 가정에서 태블릿 녹음

연령↑ 과 함께 증가

HNR · jitter(RAP·PPQ5) · shimmer(APQ3)

연령↑ 과 함께 감소

평균 F0 (여성 견인) · CPP

해석(잠정): HNR↑ · CPP↓ 의 역방향 궤적 — 연장모음 문헌과 배치, 보상적 과내전(hyperadduction) 가능성

Divergent HNR and CPP Aging Trajectories in Korean Connected Speech — Journal of Voice (수정 중)

가장 연령 민감한 6개 지표의 궤적 (논문 Figure 2)

선형혼합모형 예측·95% CI — 윗줄 4개는 증가, F0·CPP는 감소

임상 포인트 정상 노화 vs 병리 감별을 위한 한국어 연결발화 규준의 토대 — 그리고 가정 태블릿 녹음의 타당성 증거 (재검사 신뢰도·기기 효과는 향후 과제).

2026 한국언어청각임상학회 학술대회 · 기조강연

28

PART 4 · 사례 ⑤

청각임상 — 왜 문장은 되고 단어는 안 되는가

청각임상

Whisper ASR 채점 vs 청각사 4인 합의 (일치도 %)

0

25

50

75

100

인간 평정자 간 수준 (κ = 0.97)

94.0%

κ = 0.88

문장 (SRS)

60.3%

κ = 0.27

단음절 단어 (WRS)

65세 이상 난청 노년층 31명 · 한국 표준 어음청각검사

인간 vs ASR 채점 점수 (논문 Figure 1) — 문장은 따라가고, 단음절은 과소 채점

단음절은 체계적 과소 채점 — 편향 −35.0점, 정상 청력도 난청으로 오분류될 크기

LoRA 적응 시 단어 80.9% · 편향 +0.2점 — 단, 고정 어휘·탐색적, 전향적 검증 필요

핵심 제목 그대로 — 문장은 성공하고 단어는 실패한다(Why Sentences Succeed and Words Fail).

2026 한국언어청각임상학회 학술대회 · 기조강연

29

PART 4 · 사례 ⑤

그래서 임상에서는 — 되는 것, 아직인 것, 새로 열리는 것

청각임상

지금 가능

문장 검사(SRS) 채점

ASR과 청각사가 100번 중 94번 같은 판정 — 사람을 대체하는 게 아니라,
검사자마다 점수가 달라지는 문제를 줄이는 ‘이중 확인’ 보조로 쓸 만하다.

아직 불가

단어 검사(WRS) 채점

맞게 말한 답도 틀렸다고 판정해 점수를 평균 35점 깎는다 — 정상 청력도
난청처럼 보일 수 있어, 검사 어휘에 맞춘 별도 학습 없이는 쓸 수 없다.

새 가능성

반응이 남는 검사

지금 검사는 최종 점수만 남지만, 녹음·전사 기반 검사는 환자의 실제 반응이
남는다 — 다시 채점하고, 판정 이견을 검토하고, 어떤 음소를 틀리는지 볼 수 있다.

임상 포인트 자동 채점의 가치는 사람의 대체가 아니라 ‘기록의 회복’ — 점수만 남던 검사에서, 반응까지 남는 검사로.

2026 한국언어청각임상학회 학술대회 · 기조강연

30

PART 4 · 사례 ⑥

겹받침 — 한국어에서 가장 까다로운 받침

ASR·음운론

또 하나의 협업 — 이번에는 언어학자들끼리: 윤태진(성신여대) · 권수현(경희대) · 한정임(건국대), 음성학·음운론

겹받침(자음군 받침) — 받침에 자음이 두 개

닭 → [닥]

자음군 단순화 (하나만 소리 남)

닭이 → [달기]

재음절화 (모음 앞에서는 둘 다 살아남)

읽는 → [잉는]

비음동화

밝히고 → [발키고]

기식음 병합

같은 받침이 환경에 따라 네 갈래로 실현 — 음운 규칙들의 교차점

Whisper에게도 가장 어려운 지점

전체 종성 오류율

2.67 ~ 4.53%

겹받침 오류율 — 훨씬 높다

2.94 ~ 6.93%

NIKL 자발화 54,536발화 · Whisper 4종 · 서울 vs 경상

방언 효과: 서울이 경상보다 낮으나 격차는 large-v3에서 소멸 — ‘규모’가 방언 격차는 줄여도 겹받침 오류는 남긴다.

핵심 오류는 겹받침이라는 음운 구조에 몰려 있다 — 그리고 사람도 같은 곳에서 흔들린다 (다음 슬라이드).

2026 한국언어청각임상학회 학술대회 · 기조강연

31

PART 4 · 사례 ⑥

사람도 같은 곳에서 흔들린다 — 실패에도 문법이 있다

ASR·음운론

Whisper 오류의 위계 (상대 빈도 모식도)

C2 탈락 (읽고→‘일고’로 받아씀)

우세

C1 탈락 (닭이→‘다기’로 받아씀)

기식음 병합

비음동화

거의 0

재음절화

거의 0

음운론적 동기 오류 23~41% — 모델·방언 불문 일관. 오류는 무작위 잡음이 아니라 음운 문법에 뿌리를 둔 체계적 실패 지점.

인간 화자의 겹받침 — 진행 중인 음변화

/lk/의 ‘일꼬’형(C1 보존)이 1970년 이후 출생에서 급증 — 어간별 37~100% 변이 (NIKL 2,739명 코퍼스 · Glossa 투고 중)

핵심 ASR가 넘어지는 곳과 사람이 변하는 곳이 겹친다 — 이 지도를 읽는 데 각 분야의 도메인 지식이 필요하다.

2026 한국언어청각임상학회 학술대회 · 기조강연

32

PART 4 · 종합

AI 시대에 임상가·언어학자가 필요한 이유

규모(scale)가 해결한 것

정형 성인 발화의 전사 정확도

방언 간 성능 격차 (large-v3에서 소멸)

잡음·화자 변이에 대한 일반적 강건성

규모가 해결하지 못한 것

고립 단음절 채점 (κ=0.27) — 규모를 키워도 정체, 과제를 아는 적응이 필요

겹받침의 음운론적 오류 — 큰 모델에도 잔존, 인간 화자의 변이와 겹침

아동·노년·임상 음성과 그 임상 메타데이터

취약집단을 위한 과제 설계와 UX

“실패의 구조를 아는 사람이 함께할 때, 더 나은 도구가 만들어진다.”

2026 한국언어청각임상학회 학술대회 · 기조강연

33

PART 4 · 현장

한계를 분명히 — 그리고 각각의 대응

현재의 한계대응·맥락
Android 전용 (iOS 미지원)국내 아동·노년·기관 보급 기기 시장에 적합 — iOS 포팅은 로드맵 항목
진단 등 메타데이터의 자기보고 의존입력 제약·논리 교차 검증(연령 vs 집단)으로 명백한 오류 차단
통제되지 않는 가정 녹음 환경(소음 변이)단말 실시간 진폭·SNR 점검 + 서버 자동 QC로 즉시 플래그
종단 추적 기능 미비출처 있는 익명 ID 체계 — 향후 세션 연결·종단 연구의 기반
청각·임상 프로토콜 미구현팀 내 청각학·언어병리 전문가와 공동 설계 진행 중

태도 한계의 명시가 신뢰의 근거다 — 이 목록이 곧 우리의 연구 로드맵이다.

2026 한국언어청각임상학회 학술대회 · 기조강연

34

PART 4 · 현장

로드맵 — 다음 단계 네 가지

1

음성 분석·시각화 완성

백엔드에서 구현 진행 중 — ASR 전사에 음향 분석·시각화를 더해 분석 파이프라인 완결

2

iOS·크로스플랫폼

React Native 코드베이스의 iOS 포팅 — 임상 현장의 기기 다양성 수용

3

종단 데이터 연결

세션 간 연결로 발달·퇴행의 시계열 추적 — 전생애 연구의 핵심 기능

4

공개 API·오픈소스

메타데이터 스키마 · QC · 내보내기 도구 공개 — 연구 생태계로

지향 도구가 아니라 공동의 기반(foundation) — 다른 연구자들이 그 위에 자신의 프로토콜을 세울 수 있도록.

2026 한국언어청각임상학회 학술대회 · 기조강연

35

맺음말

1

말소리에는 규칙이 있다 — 비정형 발화에도.

2

그 규칙은 포괄적 데이터에서 비로소 온전히 보인다 — 인프라가 그 토대다.

3

전생애적 지원은 전생애 데이터와 다학제 협업을 요구한다.

“포괄적 의사소통과 기술 혁신” — 그 접점에, 함께 만드는 데이터 인프라가 있습니다.

2026 한국언어청각임상학회 학술대회 · 기조강연

36

감사합니다

Q&A · 토론

Contact

tyoon@sungshin.ac.kr

웹 콘솔

http://210.125.93.241:8000

Open Source

github.com/exphon/voice-recorder-app · /voice_project

공동연구: 하승희 · 윤지혜 · 한우재 · 이승진(한림대) · 소정민(서강대) · 권수현(경희대) · 한정임(건국대) 외 여러 선생님들께 감사드립니다.

2026 한국언어청각임상학회 학술대회 · 기조강연

37

APPENDIX

참고문헌 (본 발표의 근거 자료)

Yoon, T.-J. et al. (2026). Mobile–Web Integrated Platform for Atypical Korean Speech. Workshop on Speech Data Infrastructure and Clinical AI Speech Technologies (POMA).

윤태진·권수현·한정임 (2026). Whisper automatic speech recognition errors in Korean complex coda recognition. 말소리와 음성과학, 18(1), 55–63.

Yoon, T.-J. et al. (제출). Why Sentences Succeed and Words Fail: ASR for Korean Speech Audiometry in Older Adults with Hearing Loss. International Journal of Audiology.

Yoon, T.-J. et al. (수정 중). Divergent HNR and CPP Aging Trajectories in Korean Connected Speech. Journal of Voice.

Yoon, T.-J., Kwon, J., So, J., & Ha, S. (2026). Developmental Pathway of the Three-Way Contrasts of Word-Initial Stops in Young Korean-Acquiring Children. First Language, 46(1), 147–171.

Yoon, T.-J. et al. (수정 중). Developmental Patterns and Shifts in Caregiver Speech Registers in Korean Infants' Naturalistic Home Environments. Infancy.

Yoon, T.-J. et al. (수정 중). Acoustic Variability in Korean Infant-Directed Speech: A Continuum Perspective. First Language (FLA-26-0074).

Yoon, T.-J., Ha, S., & So, J. (2022). Developmental Patterns of Accentual Phrases in Korean Children's Speech. Speech Prosody 2022. — 확장 논문(동명: A Corpus-Based Investigation of Phonological Encoding and Prosodic Acquisition) 학술지 투고 중.

윤태진 (2024). Uncovering Sound Patterns from Large-Scale Speech Corpora. 한국언어학회 겨울학술대회.

Bang, H.-Y., Sonderegger, M., Kang, Y., Clayards, M., & Yoon, T.-J. (2018). The emergence, progress, and impact of sound change in progress in Seoul Korean. Journal of Phonetics, 66, 120–144.

Kang, Y., Yoon, T.-J., & Han, S. (2015). Frequency effects on the vowel length contrast merger in Seoul Korean. Laboratory Phonology, 6(3–4), 469–503.

Analogical change in progress in stem-final consonant cluster simplification: Evidence from Seoul and Gyeongsang Korean. Glossa 투고 중 — ※ 저자 표기·게재 상태 확인 후 갱신.

※ 발표 중에는 표시하지 않는 부록 슬라이드

2026 한국언어청각임상학회 학술대회 · 기조강연

38

APPENDIX

상세 수치 — Q&A 대비

연구표본핵심 수치
어음청각검사 ASR 채점 (IJA 제출)65세+ 31명 (정상~경도미만 14 · 경도 9 · 중등도 8)문장 κ=.88 (키워드 κ=.81) · 단어 κ=.27, 편향 −35.0점 · 인간 κ=.97 · LoRA 80.9% (OR 단어 13.7·문장 10.9)
연결발화 음향 노화 (JVoice)50–81세 207명 (남 77 · 여 130), 평균 61.0세HNR β=.267 · jitter RAP β=.240 · shimmer APQ3 β=.212 · F0 β=−.191 · CPP β=−.177
어두 폐쇄음 3중 대립 (First Language 46(1))아동 35명 (18–23개월 15 · 24–29개월 20) + 성인 10명VOT 연령 간 일관 · F0 역전(경음·기식 < 평음) · 연령×발성: F0·H1–H2 유의 · LDA 63.8/56.5/40.9%
양육자 레지스터 (Infancy)모–영아 28쌍 · 4–21개월 · 149회 관찰IDS 총량 무추세(BF10=0.03) · BR 91.7→86.5% · 7개월 계단 ΔBIC=−2.69 (탐색적, BF10=2.89)
IDS 연속체 (FLA)모–영아 11쌍 · 9–12개월IDS: F0↑·HNR↑·음절 수↓ · CPP·F0범위·지속시간 무차이 · dip test 대부분 단봉
겹받침 ASR 오류 (PSS 18(1))NIKL 일상대화 54,536발화 · Whisper 4종종성 2.67–4.53% · 겹받침 2.94–6.93% · 음운 동기 오류 23–41% · C2 탈락 우세
아동 강세구 성조 (SP2022 · 투고 중)AI Hub 3–10세 · ‘거북이는’ 487토큰GCA 3차항 β=.94 유의 → LHLH (8세 예외) · L→H +4.67st · VOT 68.5ms=성인 수준 · VOT→F0 비유의

※ 발표 중에는 표시하지 않는 부록 슬라이드 — 질의응답 시 참조

2026 한국언어청각임상학회 학술대회 · 기조강연

39

1 / 39
← → Space 이전 · 다음
Home / End 처음 · 끝
숫자 + Enter 해당 장으로
N 발표자 노트
O 전체 개요
F 전체화면
P 인쇄 → PDF 저장
? 이 도움말