Real-World AI Voice Interface Technology

실제 환경의 음성 입력부터 인식과 대화까지

mpWAV는 주변 잡음과 기기 에코를 줄이는 음성 전처리부터 음성 분리, 화자 구분, 호출어 감지, 음원 위치 추정, 온디바이스 음성 인식과 대화형 언어모델까지 음성 인터페이스 통합 기술을 개발합니다.

단일 마이크 스마트 디바이스부터 다채널 로봇·키오스크·차량·가전·회의 시스템까지, 제품의 오디오 입출력 구성과 연산 플랫폼에 맞는 기술 조합을 제공합니다.

mpWAV 음성 기술 스택 한눈에 보기

One Integrated Voice Stack

mpWAV의 음성 기술은 무엇을 하나요?

mpWAV의 기술은 실제 환경에서 입력되는 음성을 더 명확하게 만들고, 화자의 호출과 위치를 파악하며, 발화를 텍스트와 의도로 변환해 제품 기능이나 대화형 서비스로 연결합니다.

마이크가 하나뿐인 소형 기기부터 여러 마이크와 스피커가 함께 있는 제품까지, 필요한 기술을 맞춤 선택하여 하나의 음성 인터페이스 스택으로 통합할 수 있습니다.

음성 수집 → 음성 향상 → 음성 정제 → 음성 인식 → 대화 이해 → 제품 실행

Real-World Voice Challenges

제품마다 다른 음성 문제에는 서로 다른 기술이 필요합니다

실제 제품의 마이크에는 사용자의 목소리만 들어오지 않습니다.

주변 대화, 음악, 차량과 모터 소음, 제품 스피커 에코와 여러 사람의 발화가 함께 입력될 수 있습니다. 제품에 따라 마이크 배치의 제한이 있을 수 있으며, 음성을 인식한 이후에는 사용자의 의도와 대화 맥락을 이해해야 합니다.

mpWAV는 하나의 기술을 모든 제품에 동일하게 적용하지 않고, 제품의 문제와 하드웨어 조건에 따라 기술을 조합합니다.

단일 마이크 제품

마이크가 제한적인 이어폰과 소형 디바이스에는 단일 마이크 기반 잡음 제거가 필요합니다.

다중 마이크 제품

로봇, 키오스크와 차량에는 여러 마이크를 활용한 잡음 제거와 위치 분석이 필요합니다.

스피커가 있는 제품

제품의 응답음과 안내음이 마이크로 돌아오는 에코를 제거해야 합니다.

다자간 대화

회의와 음성채팅에서는 겹치는 음성을 분리하고 화자를 구분해야 합니다.

대화형 서비스

키오스크와 로봇은 음성 인식 이후 사용자의 의도와 맥락까지 이해해야 합니다.

마이크 수, 화자 수, 제품 출력음과 최종 서비스에 따라 필요한 기술 스택이 달라집니다.

Find the Right Technology

현재 제품의 문제를 선택하세요

제품 문제권장 기술
제품 스피커 에코가 문제mpAEC
여러 마이크로 주변 잡음을 제거해야 함mpBeamforming
에코와 주변 잡음을 함께 처리해야 함mpAB
마이크 사용이 제한적임mpNC
호출어를 감지해야 함mpWWD
여러 화자의 음성이 섞임mpSeparation
발화자의 방향이나 위치를 알아야 함mpLocalization
누가 언제 말했는지 구분해야 함mpDiarization
음성을 텍스트나 명령으로 변환해야 함mpASR
대화 맥락과 의도를 이해해야 함mpLLM
다채널 오디오 입출력이 필요함다채널 오디오 입출력 HW

실제 제품에서는 여러 문제가 동시에 발생하므로 두 개 이상의 기술을 함께 적용할 수 있습니다.

Performance Validation

기술 이름보다 실제 제품 환경의 결과로 검증합니다

음성 기술의 성능은 마이크, 스피커, 사용자 거리, 잡음 종류, 연결된 음성 인식 엔진과 실행 플랫폼에 따라 달라집니다.

그래서 일반 벤치마크 수치 대신, 고객 제품의 데이터와 현장 조건으로 측정해 결과를 제시합니다.

음성 향상

  • 에코 제거
  • 주변 잡음 제거
  • 목표 음성 보존
  • 처리 후 음질

음성 정제

  • 화자별 음성 분리
  • 화자별 음성 구분
  • 발화 구간 처리

음성 인식

  • 호출어 감지
  • 명령 성공률
  • WER/CER
  • 도메인 용어 인식
  • 온디바이스∙온프레미스

대화 처리

  • 의도 이해
  • 슬롯·옵션 추출
  • 문맥 유지
  • 발화자 방향·위치 추정

제품 성능

  • 처리 지연시간
  • 메모리 사용량
  • FPGA·DSP·AP 자원
  • 온디바이스 실행 가능성

제3자 공인 시험 실측 결과

평가항목자사 측정값출처 · 시험 조건
SRAM 메모리 요구량0.571 MB중기부 디딤돌 TTA 시험성적서(2023) · mpAB · 정적 사양
동작주파수64 MHz중기부 디딤돌 TTA 시험성적서(2023) · mpAB · 정적 사양
실시간 처리인수 (RTF)0.852중기부 디딤돌 TTA 시험성적서(2023) · mpAB · 조건 미기재
스테레오 에코 및 잡음 억제 성능42.088 dB중기부 디딤돌 TTA 시험성적서(2023) · mpAB · 시험 기준 40 dB 이상

중소벤처기업부 디딤돌 사업 TTA 시험성적서(2023, mpAB 대상) 실측 결과입니다.

Speech Enhancement

음성 인식에 전달되기 전 입력 신호부터 개선합니다

음성 인식 성능은 음성 인식 모델뿐 아니라 마이크에 입력되는 음성의 품질에 영향을 받습니다.

mpWAV는 단일 마이크와 다중 마이크, 기기 에코와 주변 잡음 등 제품의 음향 조건에 맞는 음성 향상 기술을 제공합니다.

mpAEC

기기 스피커에서 발생한 에코를 제거합니다

mpAEC는 TV, 차량 오디오, 로봇 응답음과 키오스크 안내 음성처럼 제품에서 출력된 소리가 마이크로 다시 들어오는 음향 에코를 제거하는 다채널 AEC 기술입니다.

사용자가 발화하는 중에도 지속적으로 튜닝해 안정적으로 제거하며, 처리된 신호를 빔포밍이나 기존 음성 인식 엔진으로 전달할 수 있습니다.

주요 문제

  • 스피커 출력음의 마이크 재유입
  • 사용자 발화 시에 성능 저하
  • 변화하는 에코 경로
  • 실시간 처리

대표 적용

  • 차량
  • 로봇
  • 키오스크
  • 가전
  • 스마트홈
  • 회의 시스템

근거

논문
IEEE Transactions on Signal Processing 게재
특허
국내 등록 2건 · 해외 등록 2건 · PCT 1건
거실에서는 TV와 스피커 소리가, 차량에서는 오디오와 주행 잡음이 사용자의 음성 명령과 함께 마이크로 들어오는 구조. 파란 점선이 mpAEC가 제거하는 에코 경로입니다
거실과 차량에서 기기 스피커가 낸 소리가 마이크로 되돌아오는 에코 경로

mpBeamforming

다중 마이크로 주변 잡음을 제거하고 목표 음성을 강화합니다

mpBeamforming은 여러 마이크에 입력되는 신호의 공간적 정보를 활용해 주변 잡음을 제거하고 목표 음성을 선명하게 전달합니다.

mpWAV 기술은 마이크간 상대적 위치 정보가 아닌 실제 입력 신호를 기반으로 최적화해, 제품별 마이크 배치 변경에도 별도 튜닝이 필요하지 않습니다.

주요 문제

  • 원거리 사용자 음성
  • 여러 방향의 주변 잡음
  • 제품별 마이크 배열 변화
  • 잡음 제거 과정의 목표 음성 왜곡

대표 적용

  • 로봇
  • 키오스크
  • 차량
  • 가전
  • 스마트홈
  • 회의 시스템

근거

논문
IEEE/ACM Transactions on Audio, Speech and Language Processing 게재
특허
국내 등록 3건 · 해외 등록 2건 · 출원 3건 · PCT 1건
수상
2024 대한민국 발명특허대전 국무총리상

mpAB

에코 제거와 빔포밍을 동시에 최적 통합합니다

mpAB는 mpAEC와 mpBeamforming을 결합해 제품 스피커 에코와 외부 환경 잡음이 함께 존재하는 입력을 처리합니다.

다채널 마이크, 스피커 레퍼런스, FPGA·DSP·AP와 기존 음성 인식 엔진을 하나의 제품 아키텍처로 연결할 수 있습니다.

주요 문제

  • 에코와 주변 잡음의 동시 발생
  • 다채널 오디오 입출력 실시간 처리 어려움
  • 신호 왜곡으로 인한 음성 인식 성능 저하
  • 제품 하드웨어 통합

대표 적용

  • 로봇
  • 키오스크
  • 차량
  • 가전
  • 스마트 디바이스
  • 회의 장치

근거

인증
2025 신기술(NET) 인증 — 대화 인터페이스용 음성인식 및 향상을 위한 전처리 기술
빨간 점선은 mpBeamforming이 제거하는 청소기·스피커·TV 잡음, 파란 점선은 mpAEC가 제거하는 제품 스피커 에코이며, 둘을 통합한 mpAB가 마이크 어레이 입력을 함께 처리해 스마트 기기로 전달합니다
빔포밍이 맡는 주변 잡음과 mpAEC가 맡는 스피커 에코가 한 구조 안에서 처리되는 모습

mpNC

마이크가 제한적인 제품의 단일 마이크 잡음 제거

mpNC는 하나의 마이크 입력을 기반으로 주변 잡음을 제거하는 음성 향상 기술입니다.

마이크 배열을 설치하기 어려운 이어폰, 모바일 액세서리, 소형 스마트 디바이스와 제한된 하드웨어 구조에서도 음성 입력을 개선할 수 있는 기술적 기반을 제공합니다.

주요 문제

  • 마이크를 추가할 수 없는 제품 구조
  • 소형 기기의 공간 제약
  • 주변 생활 소음
  • 제한된 연산 자원

대표 적용

  • 이어폰
  • 웨어러블
  • 스마트폰 액세서리
  • 소형 가전
  • 깨끗이앱(ClearSense Audio) 연계 기기

Speech Refinement

음성을 깨끗하게 만드는 것을 넘어 다중 화자 음성을 분리하고 화자별로 정리합니다

여러 사람이 발화를 하는 한층 복잡한 상황에서는 각자의 음성을 분리하고 누가 언제 발화를 했는지 파악해야 합니다.

mpWAV의 음성 정제 기술은 다중 화자가 발화하는 상황에서 필요한 정보를 제공합니다.

mpSeparation

다중 화자 음성 입력을 화자별 음성으로 분리합니다

mpSeparation은 회의와 음성채팅처럼 여러 음성이 존재하거나 발화가 겹칠 수 있는 환경에서 혼합 음성 신호를 각 화자별 음성으로 분리하는 기술입니다.

mpDiarization, mpASR과 결합해 다자간 회의 기록과 음성채팅 입력 구조를 구성할 수 있습니다.

주요 문제

  • 여러 화자의 음성 중첩
  • 다자간 대화
  • 음성채팅의 복합 입력
  • 화자 구분 전 신호 분리

대표 적용

  • 회의
  • 원격 협업
  • 음성채팅
  • 상담 기록
  • 다자간 대화

근거

논문
NeurIPS 2024 — Separate and reconstruct: Asymmetric encoder-decoder for speech separation
겹쳐 들어온 발화를 화자별로 나누는 mpSeparation 실제 동작입니다.

mpDiarization

누가 언제 말했는지 구분합니다

mpDiarization은 여러 사람이 발화한 음성에서 발화 구간을 화자별로 구분합니다.

회의록, 상담 기록과 음성채팅에서 화자별 발화를 정리하고, mpASR가 생성한 텍스트에 화자 정보를 연결할 수 있습니다.

주요 역할

  • 화자별 발화 구간 구분
  • 발언자 전환 감지
  • 회의록 화자 태깅
  • 상담·대화 기록 구조화

대표 적용

  • 회의록
  • 원격회의
  • 상담 기록
  • 음성채팅
  • 인터뷰 분석

Speech Recognition and Dialogue

음성을 텍스트로 바꾸고 의도와 대화 맥락, 관련 정보를 이해합니다

음성 향상과 정제를 거친 입력은 mpWWD에서 호출어가 감지되고, mpASR에서 텍스트로 변환됩니다.

대화형 인터페이스가 필요한 경우 mpLLM이 인식 결과와 대화 맥락을 이해해 질문, 응답과 제품 기능을 연결합니다. 또한, mpLocalization은 발화자의 방향을 제공합니다.

mpWWD

호출어를 감지해 음성 인터페이스를 시작합니다

mpWWD는 미리 정의된 호출어를 감지해 제품이 음성 명령 수신을 시작하도록 지원합니다.

항상 음성을 서버로 전송하지 않고 제품 내부에서 호출 시점을 판단해야 하는 로봇, 스마트홈, 차량과 엣지 디바이스에 연결할 수 있습니다.

주요 역할

  • 호출어 감지
  • 음성 인터페이스 활성화
  • 상시 대기 구조
  • 온디바이스 명령 흐름 시작

대표 적용

  • 로봇
  • 차량
  • 가전
  • 스마트홈
  • 키오스크
  • 웨어러블

mpASR

소음 환경에 강한 온디바이스∙온프레미스 End-to-End ASR

mpASR은 서버, PC, 스마트 디바이스와 IoT·엣지 환경에서 실행할 수 있도록 설계된 mpWAV의 음성 인식 기술입니다.

제품의 전문 용어, 메뉴명과 명령체계에 맞는 도메인 파인튜닝을 지원하며, mpWAV 음성 전처리를 앞단에 두면 잡음 환경에서의 인식률이 함께 올라갑니다.

주요 역할

  • 음성을 텍스트로 변환
  • 제품 명령 인식
  • 도메인 파인튜닝
  • 온디바이스∙온프레미스 독립 실행

대표 적용

  • 키오스크
  • 로봇
  • 차량
  • 가전
  • 스마트 디바이스
  • 회의 기록

mpLLM

대화와 의도를 이해하는 특정 도메인 맞춤형 언어모델

mpLLM은 mpASR이 변환한 텍스트를 바탕으로 사용자의 의도, 대화 맥락과 제품 기능을 연결하는 대화형 언어모델입니다.

키오스크 음성 주문처럼 네트워크 의존도를 낮춰야 하는 제품에서, 메뉴 구조와 주문 규칙을 학습시켜 제품에 맞는 대화 흐름을 만듭니다.

주요 역할

  • 사용자 의도 이해
  • 대화 맥락 유지
  • 부족한 정보 추가 질문
  • 메뉴·옵션·수량 해석

대표 적용

  • 대화형 키오스크
  • 로봇 대화
  • 가전 대화
  • 스마트 디바이스
  • 차량 인터페이스
  • 회의 요약

mpLocalization

음성이 들어오는 방향∙위치를 추정합니다

mpLocalization은 다중 마이크 입력을 활용해 사용자 음성이 들어오는 방향 또는 위치 정보를 추정합니다.

로봇이 사용자를 향해 회전하거나, 차량이 좌석별 발화를 구분하고, 전방향 스마트 디바이스가 화자 방향에 반응하는 인터페이스에 활용할 수 있습니다.

주요 역할

  • 음원 방향 추정
  • 사용자 위치 정보
  • 좌석·방향 기반 인터랙션
  • 로봇 시선·회전 제어 연계

대표 적용

  • 로봇
  • 차량
  • 스마트홈
  • 회의 장치
  • 전방향 스마트 디바이스

Hardware and Embedded Implementation

알고리즘을 실제 작동하는 시스템으로 구현합니다

mpWAV의 기술을 실제 제품에 적용하려면 마이크 입력, 스피커 출력, AEC 레퍼런스, 처리 플랫폼과 음성 인식 시스템이 함께 연결되어야 합니다.

mpWAV는 제품 맞춤형 다채널 마이크 배열과 오디오 입출력 하드웨어 설계, FPGA 구조와 AP·DSP 포팅 및 시스템 통합을 지원합니다.

마이크 배열

제품 형태와 사용자 방향에 맞는 선형·원형 배열을 설계합니다.

다채널 오디오 I/O

복수 마이크와 스피커 레퍼런스 신호를 고속으로 취득∙전달합니다.

FPGA

다채널 음성 전처리를 실시간으로 구현하고 SoC 이전 구조를 검증합니다.

DSP·AP

고객 제품의 연산 환경에 알고리즘을 포팅합니다.

경량·단일 마이크 구현

마이크 배열을 적용하기 어려운 기기에는 mpNC와 경량 모델 구조를 검토합니다.

MEMS 마이크 배열 입력이 PDM2PCM·디지털 앰프·USB FS 를 거치는 메인 PCB 블록도와, mpUSB104K·mpUSB106K 의 입출력 사양 비교표
다채널 오디오 입출력 보드 블록도와 mpUSB104K·mpUSB106K 사양

Application Technology Map

적용 분야마다 필요한 기술 스택이 다릅니다

로봇

  1. 1

    다채널 오디오 입출력 HW

    다채널 음성 수집·출력

  2. 2

    mpWWD

    호출어 감지

  3. 3

    mpLocalization

    사용자 방향 추정

  4. 4

    mpAEC

    로봇 응답음 에코 제거

  5. 5

    mpBeamforming / mpAB

    모터·팬·주변 대화 제거

  6. 6

    mpASR

    명령 인식

  7. 7

    mpLLM

    대화와 의도 이해

키오스크

  1. 1

    다채널 오디오 입출력 HW

    정면 사용자 음성 수집

  2. 2

    mpAEC

    키오스크 안내음 에코 제거

  3. 3

    mpBeamforming / mpAB

    매장 잡음∙주변 대화 제거

  4. 4

    mpASR

    메뉴·옵션 음성 인식

  5. 5

    mpLLM

    자동 주문 및 추가 질문 생성

스마트 디바이스·이어폰

  1. 1

    다채널 오디오 입출력 HW

    음성 입출력 처리

  2. 2

    mpNC

    단일 마이크 잡음 제거

  3. 3

    mpWWD

    호출어 감지

  4. 4

    mpASR

    명령 인식

  5. 5

    mpLLM

    명령 이해 및 대화 생성

회의·음성채팅

  1. 1

    다채널 오디오 입출력 HW

    다채널 회의 음성 수집

  2. 2

    mpSeparation

    다중 발화 음성 분리

  3. 3

    mpDiarization

    화자별 발화 구분

  4. 4

    mpAEC

    스피커 에코 제거

  5. 5

    mpBeamforming / mpAB

    주변 잡음 제거

  6. 6

    mpASR

    회의 내용 텍스트 변환

  7. 7

    mpLLM

    요약 및 정리

차량·모빌리티

  1. 1

    다채널 오디오 입출력 HW

    차량 내 다채널 음성 수집

  2. 2

    mpWWD

    호출어 감지

  3. 3

    mpLocalization

    좌석·발화 방향 분석

  4. 4

    mpAB

    차량 오디오 에코 및 주변 잡음 제거

  5. 5

    mpSeparation

    동승자 음성 분리

  6. 6

    mpASR

    차량 명령 인식

  7. 7

    mpLLM

    자연어 차량 인터페이스

From Algorithm to Product

기술 검토부터 제품 통합까지 필요한 형태로 제공합니다

Software

기존 제품과 음성 인식 엔진을 유지하면서 mpWAV 기술을 적용합니다.

PoC·성능 검증

실제 음성 데이터로 기술 적용 전후를 확인합니다.

마이크 배열·HW 모듈

다채널 오디오 입출력과 처리 구조를 제품에 연결합니다.

FPGA·DSP·AP 포팅

고객 제품의 연산 플랫폼에 기술을 적용합니다.

기술 라이선스·공동개발

제품 데이터와 서비스 목적에 맞게 기술을 통합합니다.

온디바이스 모델 최적화

mpASR와 mpLLM을 목표 플랫폼의 메모리와 연산조건에 맞게 검토합니다.

SoC·반도체 IP 협력

대량 생산과 소형화를 위한 전용 구조로 확장합니다.

Research and Intellectual Property

연구성과를 실제 음성 인터페이스로 연결합니다

mpWAV는 음성·오디오 신호처리와 음성 인식 연구를 특허, 소프트웨어, 임베디드 구현과 제품 PoC로 확장합니다.

핵심 기술은 서강대학교 연구실에서 시작해 특허 8건 기술이전으로 회사에 넘어왔고, mpAEC와 mpBeamforming은 각각 IEEE Transactions on Signal Processing 과 IEEE/ACM Transactions on Audio, Speech and Language Processing 에 게재됐습니다.

Research → Patent → Algorithm → Embedded Implementation → Product

FAQ

mpWAV 기술에 대해 자주 묻는 질문

아닙니다.

mpWAV의 기술 포트폴리오는 단일·다중 마이크 음성 향상, 음성 분리, 화자 구분, 호출어 감지, 위치 추정, 음성 인식과 온디바이스 대화형 언어모델까지 포함합니다.

네. mpNC가 그 경우를 위한 기술입니다.

단일 마이크 입력만으로 주변 잡음을 제거합니다.

이어폰과 소형 스마트 디바이스처럼 마이크 배열을 설치하기 어려운 제품의 적용 기반이 됩니다.

문제에 따라 갈립니다.

주변 잡음만 있으면 mpBeamforming, 제품 스피커 에코가 있으면 mpAEC, 둘 다 있으면 두 기술을 통합한 mpAB를 씁니다.

네. mpLocalization이 다중 마이크를 활용해 사용자 음성이 들어온 방향과 위치를 추정합니다.

구체적인 방향 정확도와 지원 배열은 실제 제품 구조로 검증해야 합니다.

네. mpDiarization이 여러 사람의 음성에서 누가 언제 말했는지 구분합니다.

mpSeparation, mpASR와 결합하면 다자간 회의 음성을 분리하고 화자별 텍스트로 정리하는 구조를 검토할 수 있습니다.

네.

mpASR가 음성을 텍스트로 변환하고, mpLLM이 메뉴·옵션·수량과 대화 맥락을 해석합니다.

실제 적용에는 주문 API, 메뉴 데이터, 안전정책과 목표 하드웨어 검증이 필요합니다.

현재는 모든 기술을 이 기술 개요 페이지의 독립 섹션에서 설명합니다.

mpAEC, mpBeamforming, mpAB, mpASR와 다채널 오디오 입출력 HW는 자료가 갖춰지는 대로 독립 상세 페이지로 확장할 예정입니다.

네. 구조상 교체할 이유가 없습니다.

전처리는 마이크와 음성 인식 사이에 들어가 입력 신호만 다듬습니다. 인식 엔진의 입력 형식은 그대로이므로 엔진 쪽을 고칠 일이 없습니다.

오히려 엔진을 바꾸지 않은 채로 전후를 비교하면 전처리의 효과만 따로 측정할 수 있습니다.

아닙니다.

마이크 수와 배치, 스피커, 공간, 잡음, 사용자 거리, 실행 플랫폼과 연결된 모델에 따라 결과가 달라질 수 있습니다. 실제 제품 데이터로 검증해야 합니다.

Build Your Voice Technology Stack

제품에 필요한 음성 기술을 하나의 스택으로 설계하세요

제품 유형, 마이크 수, 스피커 구조, 잡음 환경과 구현하려는 음성 기능을 알려주시면 적합한 mpWAV 기술 조합을 검토합니다.

단일 마이크 잡음 제거부터 다채널 에코·잡음 전처리, 화자별 음성 분리∙구분, 온디바이스 호출어 검출∙음성 인식과 대화형 LLM, 발화자 방향 추정까지 제품 환경에 맞게 연결할 수 있습니다.