-
SSL DTW 고도화 Phase 2: 운영 정책 결정
SSL DTW는 앵무새가 보호자의 단어를 따라 했는지 판정하는 방법이다. 고도화 Phase 2에서 Phase 1에 채택한 ContentVec 레이어 8을 변경 없이 유지하고, 운영에 필요한 정책 4개를 같은 쌍 점수 행렬에서 비교했다. 이 글을 읽으면 정책 4개가 무엇으로 결정됐고, 그 근거 수치가 무엇이... Read More
-
SSL DTW 고도화 Phase 1: 인코더 선정
SSL DTW는 앵무새가 보호자의 단어를 따라 했는지 판정하는 방법이다. 고도화 Phase 1에서 사전학습 음성 인코더 9개를 같은 조건에서 비교해 ContentVec 레이어 8을 채택했다. 요약 채택 인코더: ContentVec 레이어 8 채택 기준: non_speech ... Read More
-
[후보 방법론 5] 사람 기준음성 프로토타입
보호자 기준음성의 평균 벡터 하나로 앵무새의 ‘안녕’ 모사를 판정하는 방법을 시험했다. 단어 일치 AUC는 후보 방법론 1인 SSL+DTW와 같은 수준이었다. FAR 5% 기준 검출률은 공용 기준음성에서 15.3%, 같은 계정 기준음성에서 7.0%로, SSL+DTW의 23.2%와 18.6%보다 낮았다. ... Read More
-
[후보 방법론 4] Cross Species Metric Learning
전체 파이프라인에 대한 부분은 아래 글을 참고. https://daeunworld.xyz/aisw_maestro/2026/09/23/parrot-mimicry-pipeline-status.html 이 글의 수치는 2026-09-28 라벨 스냅샷 기준이다. 앵무 발화(mimic) 라벨 재검토는 아직 반영하지... Read More
-
[후보 방법론 2] mimic vs non_speech를 판별하는 선형 probe
0. 용어 정리 mimic: 앵무새가 사람 단어를 흉내 낸 클립. 사람이 듣기에 일상 발성과 다른 느낌을 준다 non_speech: 앵무새의 일상 발성 클립. 일반적인 짹짹 소리. 계정: 서비스에 등록된 한 가정. 대체로 한 마리 앵무와 보호자 선형 probe: 임베딩을 입력으로 사용하는 로지... Read More
-
[개발 현황] 앵무새의 단어 모사 성공 여부 판정 파이프라인
0. 용어 정리 용어 의미 VAD Voice Activity Detection. 오디오에서 소리가 있는 구간만 잘라내는 처리 클립 판정 대상 오디오 한 개 ... Read More
-
앵무새 단어 모사 소리의 음향학적 특징 규명
1. 목적 앵무새의 mimic과 non_speech와의 음향학적 차이를 확인한다. 조사된 음향학적 차이점을 이용하여, 앵무새 모사 성공 여부 판별 모델(mimicry-judgement)를 개발할 수 있도록 한다. 2. 용어 정리 mimic: 앵무새가 사람 단어를 흉내 낸 클립. 안녕, 사랑해,... Read More
-
앵무새 소리 여부 판별 모델 (parrot sound gate) v2.0.0
v2.0.0의 분류기로 대형조를 포함해 학습한 Logistic Regression(LR)을 채택한다. 이 보고서는 채택한 LR의 데이터 구성, 학습 설정, 임계값 정책, 개발 평가 결과를 설명한다. 1. 용어 용어 의미 클립... Read More
-
[버디버드] 데이터 라벨링 시스템 구축
이 글은 S3 운영 오디오를 클립 단위로 라벨링하기 위해 구성한 데이터 구조와 작업 절차를 설명한다. 라벨 원장, 자동 판정, 작업 배정 필드가 어떤 역할을 하는지 확인할 수 있다. 1. 라벨링 시스템의 필요성 버디버드앱의 핵심 기능을 위해서는 아래 기술을 개발해야 한다. 앵무새 소리 여부 판별 모델: 비앵... Read More
-
실데이터 1.6만에 대한 '앵무새 소리 여부 판별 모델' v1 성능 테스트
v1.0.0 게이트를 개발한 이후, 버디버드 앱을 통해 신규 오디오 데이터가 수집되었다. 이 보고서는 신규 데이터에 대해 앵무새 소리 여부 판별 모델(parrot-sound-gate v1.0.0)의 성능을 분석한 내용이다. 평가 대상 모델의 구조와 초기 학습 데이터, 임계값 선정 방식은 앵무새 소리 게이... Read More
