1. 목적
앵무새의 mimic과 non_speech와의 음향학적 차이를 확인한다.
조사된 음향학적 차이점을 이용하여, 앵무새 모사 성공 여부 판별 모델(mimicry-judgement)를 개발할 수 있도록 한다.
2. 용어 정리
- mimic: 앵무새가 사람 단어를 흉내 낸 클립. 안녕, 사랑해, 코코야 등등
- non_speech: 앵무새의 비발화 클립. 단어 시도가 아닌 일반 발성으로, 짹짹거림과 경보음 같은 종 고유 발성이다
- 계정: 서비스에 등록된 한 가정. 대체로 한 마리 앵무와 보호자를 의미한다.
- 해석 특징: 사람이 뜻을 이해할 수 있는 음향학적 특징.
- AUC: 두 클래스를 구분하는 정도. 0.5는 무작위 추측, 1.0은 완전 구분이다. 이 글의 AUC는 별도 표기가 없으면 계정 내 비교 기준이다
- HNR: 하모닉 대 잡음 비율. 소리가 목소리처럼 맑은 정도를 측정한다
- 효과크기 g: 두 클래스 평균 차이를 표준편차 단위로 측정한 값. 0.2 부근이면 작은 차이다
3. 실험 설계
3-1. 데이터
소형조와 중형조 앵무 클립만 사용했다(대형조 제외).
| 구분 | 수 |
|---|---|
| mimic | 1,123클립 |
| non_speech | 5,321클립 |
| 두 클래스를 모두 가진 계정 | 23개 |
| 분석 적격 계정(클래스별 5클립 이상) | 13개 |
3-2. 해석 특징 34개
| 계열 | 대표 특징 | 측정 대상 |
|---|---|---|
| 유성, 하모닉 | HNR, 유성 확률, F0(피치) 통계 | 소리가 목소리처럼 맑은 정도 |
| 시간, 리듬 | 4~8Hz 변조 비율, onset 밀도 | 사람 말의 음절 리듬(초당 4~8회) 존재 정도 |
| 스펙트럼, 포먼트 | centroid, F1~F3, F1/F2 변동 | 소리 색과 그 움직임(모음 유사 변화) |
| 음역대 | 대역별 에너지 비율(1kHz 이하, 1~4kHz, 4kHz 이상) | 에너지가 분포하는 대역 |
| 상대 음량 구조 | 무음 비율, 다이나믹레인지 | 클립 안의 강약 구조 |
클립 길이와 절대 음량(RMS, peak)은 판별 특징에서 제외했다. 두 값은 디바이스와 앵무새 사이 거리의 산물이기 때문이다.
특히 클립 길이는 모바일 앱이 고정 VAD 임계값으로 잘라낸 결과라 발성 유형의 음향 특성으로 볼 수 없다. 두 값은 아래 교란 통제(매칭)에만 사용했다.
3-3. 교란 통제
녹음 환경(기기, 거리, 배경 소음)이 계정마다 다르다. 계정 구분 없이 비교하면 mimic의 특징 대신 각 가정의 녹음 특성을 학습하게 된다. 그래서 통제 세 가지를 적용했다.
- 계정 내 비교: 같은 계정 안의 mimic vs non_speech 쌍만 비교한다(주 분석)
- 매칭: 같은 계정에서 길이와 음량이 비슷한 클립 742쌍을 짝지어 재확인한다
- 세션 내 비교: 같은 녹음 세션에서 나온 클립끼리만 비교한다
계정을 무시한 PCA와 UMAP을 그리면 통제의 필요성이 드러난다. 군집은 계정 기준으로 형성된다(그림 오른쪽). 클래스 기준으로는 군집이 형성되지 않는다(그림 왼쪽).

4. 결과
4-1. 단일 특징으로는 판별 불가
34개 특징 전부, 계정 내 AUC가 0.59 미만이었다(최고 0.581). 매칭 후 최고가 0.629이고, 세션 내에서는 0.565다.
| 순위 | 특징 | 계정 내 AUC | 매칭 후 | 세션 내 |
|---|---|---|---|---|
| 1 | F1 변동(f1_std) | 0.581 | 0.629 | 0.565 |
| 2 | 하모닉 비율(HNR) | 0.581 | 0.603 | 0.563 |
| 3 | 스펙트럼 평탄도 | 0.420 | 0.484 | 0.462 |
| 4 | rolloff(고역 상한) | 0.574 | 0.507 | 0.503 |
| 5 | 유성 확률 | 0.574 | 0.590 | 0.559 |
| 6 | centroid(소리 색 중심) | 0.569 | 0.477 | 0.511 |
rolloff와 centroid는 녹음 조건과 상관된 신호였다. 길이와 음량을 맞춘 매칭에서 판별력이 0.5 부근으로 감소했기 때문이다.
상위 특징의 분포를 보면 중앙값 차이는 있지만 분포 대부분이 겹친다.

4-2. 약한 공통 경향은 존재
통제 세 가지를 전부 통과한 경향은 다음과 같다.
| 공통 경향 | 방향 | 매칭 742쌍 중 mimic이 큰 비율 |
|---|---|---|
| F1/F2 대역 변동(포먼트형 움직임) | mimic 큼 | 64% |
| 하모닉 비율(HNR) | mimic 큼 | 60% |
| 유성 확률 | mimic 큼 | 57% |
| 스펙트럼 이동률(centroid 변화량) | mimic 큼 | 59% |
| 음절률(4~8Hz) 변조 | mimic 큼 | 57% |
| onset 밀도 | mimic 작음 | 43% |
mimic은 같은 새의 비발화보다 더 맑고(HNR 큼), 모음처럼 소리 색이 움직이며, 사람 음절 속도의 리듬을 보인다.
- mimic과 non_speech을 구분하는 지표로 삼을 정도로, 판별력이 높은 특징은 없다. 전부 AUC 0.63 이하, 효과크기 g 0.3 이하다
- 13개 계정 중 3~5개 계정에서 방향이 반대다. 보편 법칙 수준에 미달하는 평균 경향이다
- F1/F2 변동이 실제 포먼트 움직임인지, 높은 피치의 하모닉 추적 오류인지 검증하지 못했다
한편 F0(피치) 계열은 전부 AUC 0.46~0.52로 판별력이 없었다. mimic이 사람 음역대(85~300Hz)로 이동한다는 가설은 이 데이터에서 지지되지 않았다.
4-3. 차이는 실재하나 명명 불가
같은 조건(계정 그룹 교차검증, 계정 내 AUC)에서 조류 소리 전용 모델 Perch 2.0의 임베딩과 해석 특징을 비교했다.
| 조건 | 해석 특징 34개 | Perch 임베딩 1536차원 |
|---|---|---|
| 계정 내 AUC | 0.602 | 0.728 |
| 계정 평균 AUC | 0.674 | 0.758 |
| 세션 내 AUC | 0.545 | 0.648 |
| 길이, 음량 매칭 | 0.606 | 0.749 |
안녕 mimic만 |
0.591 | 0.736 |
안녕 제외 mimic만 |
0.635 | 0.703 |
- Perch는 모든 조건에서 해석 특징보다 AUC 0.07~0.15 높다
- 세션 내부로 조건을 좁히면 0.648로 감소한다. 신호의 일부는 세션 요인일 수 있다
- 단어 제한 두 조건에서 모두 분리가 유지되므로, 특정 단어 하나의 검출로는 설명되지 않는다

두 소리를 구분하는 정보는 클립 안에 분명히 있다. 그 정보는 미세한 스펙트럼-시간 패턴에 분산되어 있다. 피치나 리듬 같은 단일 음향축으로는 환원되지 않는다. 사람이 “말 같다”고 느끼는 판단은 여러 단서의 종합이기 때문일 수 있다.
4-4. 라벨 경계의 모호함
분류 점수의 양 극단(오분류 극단 클립)을 스펙트로그램으로 확인했다.

- 위 행(non_speech인데 고점수): 하모닉 스택과 음절형 반복 구조를 보인다. 말과 유사한 비발화다
- 아래 행(mimic인데 저점수): 브로드밴드 잡음이 지배하고 신호 대 잡음비(SNR)가 낮다. 잡음 속의 모사 발성이다
옹알이 단계의 발성, 잡음 속 모사처럼 라벨 경계가 애매한 사례의 존재 가능성을 스펙트로그램이 시사한다. 오라벨 여부의 확정은 청취 없이는 불가능하다. 최강 표현(Perch)으로도 점수 분포의 겹침 계수가 0.61이다. 청취 재라벨링 없이는 달성 가능한 상한을 정량화할 수 없다.
전형 사례와 혼동 사례를 계정별로 나란히 보면 차이가 더 선명하다.

5. 결론
- mimic과 non_speech를 구분하는 해석 가능한 정적 음향 특징은 확인되지 않는다. 34개 특징을 전부 결합해도(다변량) AUC 0.60~0.67로, 임베딩(0.73~0.76)에 미달한다.
- 약한 공통 경향(하모닉 비율, 포먼트 변조, 음절 리듬)은 가설과 방향이 일치하지만
단독 판정 근거로는 부족하다.
