전체기사 최신뉴스 GAM
KYD 디데이
산업 ICT

속보

더보기

카카오, 한국어 최적화 멀티모달 AI '카나나' 2종 성능 공개

기사입력 :

최종수정 :

※ 본문 글자 크기 조정

  • 더 작게
  • 작게
  • 보통
  • 크게
  • 더 크게

※ 번역할 언어 선택

통합 멀티모달 언어모델 '카나나-o', 지시이행 능력 개선
이미지 기반 검색 기술 '임베딩'…"韓 문화 이해도 탁월"

[서울=뉴스핌] 이성화 기자 = 카카오가 사람처럼 보고 듣고 말하며 한국어와 한국 문화를 가장 잘 이해하는 고도화된 멀티모달 인공지능(AI) 기술 연구 성과를 공개했다.

카카오는 12일 테크블로그를 통해 한국적 맥락 이해에 최적화된 통합 멀티모달 언어모델 '카나나-o(Kanana-o)'와 멀티모달 임베딩 모델 '카나나-v-임베딩(Kanana-v-embedding)'의 개발 과정과 성능을 공개했다.

Kanana-o와 글로벌 경쟁모델 벤치마크 성능비교. [사진=카카오]

'카나나-o'는 텍스트와 음성, 이미지를 동시에 이해하고 실시간으로 답변하는 통합 멀티모달 언어모델이다. 글로벌 모델 대비 한국어 맥락 이해에서 압도적 성능을 보유하고 있으며 사람처럼 자연스럽고 풍부한 표현력을 갖춘 것이 특징이다.

카카오는 기존 멀티모달 모델들이 텍스트 입력 시 강점을 보이지만 음성 대화에서는 답변이 단순해지고 추론 능력이 떨어지는 한계에 주목해 이를 보완했다. '카나나-o'의 지시 이행 능력을 고도화해 사용자의 숨은 의도와 복잡한 요구사항까지 파악할 수 있도록 개선했으며 자체 구축 데이터셋으로 학습해 다양한 모달리티 입출력에서도 기존 언어모델 성능을 유지하고 요약, 감정 및 의도 해석, 오류 수정, 형식 변환, 번역 등 다양한 과업을 수행할 수 있도록 성능을 끌어올렸다.

또한 고품질 음성 데이터와 직접 선호 최적화(DPO) 기술을 적용해 억양, 감정, 호흡 등을 정교하게 학습시켰다. 이를 통해 기쁨, 슬픔, 분노, 공포 등 상황별 생생한 감정 표현은 물론 미세한 음색과 어조 변화에 따른 감정 표현 능력도 향상됐다. 호스트와 게스트가 대화를 주고받는 팟캐스트 형태의 대화 데이터셋을 구축해 끊김 없이 자연스러운 멀티턴 대화도 가능해졌다.

벤치마크 평가 결과 '카나나-o'는 영어 음성 성능에서 GPT-4o와 유사한 수준을 보였고 한국어 음성 인식 및 합성, 감정 인식 능력에서는 월등히 높은 수준을 기록했다. 카카오는 향후 더욱 자연스러운 동시 대화와 상황에 맞는 소리환경 실시간 생성이 가능한 진화된 모델로 발전시킬 계획이다.

함께 공개된 '카나나-v-임베딩'은 이미지 기반 검색의 핵심 기술로 텍스트와 이미지를 동시에 이해해 처리할 수 있는 한국형 멀티모달 모델이다. 텍스트로 이미지를 검색하거나 사용자가 선택한 이미지와 관련된 정보를 찾고 이미지가 포함된 문서 검색도 지원한다.

Kanana-v-embedding 벤치마크 성능 비교. [사진=카카오]

특히 한국어와 한국 문화에 대한 이해도가 탁월해 '경복궁', '붕어빵' 같은 고유명사뿐만 아니라 '하멜튼 치즈'처럼 오타가 포함된 단어도 문맥을 파악해 정확한 이미지를 찾아준다. '한복 입고 찍은 단체 사진'처럼 복합 조건도 정확히 이해해 조건 일부에만 해당하는 사진을 걸러내는 높은 변별력을 갖췄다.

현재 '카나나-v-임베딩'은 카카오 내부에서 광고 소재 유사도 분석 및 심사 시스템에 적용 중이며 향후 비디오나 음성으로 범위를 확대해 다양한 서비스에 적용할 계획이다.

한편 카카오는 지난 5월 에이전틱 AI 구현을 위한 기능 강화에 중점을 둔 언어모델 '카나나-1.5'를 기반으로 모바일 기기 등 온 디바이스 환경에서 동작할 수 있는 멀티모달 모델의 경량화 연구를 진행하고 있다. 또한 전문가 혼합 구조인 MoE(Mixture of Experts)를 적용한 고성능·고효율 모델 '카나나-2' 개발도 준비하고 있다.

김병학 카카오 카나나 성과리더는 "카카오 자체 AI 모델 카나나는 단순 정보 나열을 넘어 사용자의 감정을 이해하며 친숙하고 자연스럽게 대화하는 AI가 될 수 있도록 한국적 맥락 이해와 표현력을 높여가고자 한다"며 "실제 서비스 환경을 통해 사용자들의 일상 속 AI 기술 경험을 만들어 나가고 사람처럼 상호작용할 수 있는 AI 구현에 주력할 것"이라고 말했다.

shl22@newspim.com

[뉴스핌 베스트 기사]

사진
내년 의대 490명 더 뽑는다 [서울=뉴스핌] 황혜영 기자 = 2027학년도 의과대학 모집 정원이 3548명으로 늘면서 전년보다 490명이 증원된다. 이에 따라 의대 합격선 하락과 재수 이상 'N수생' 증가, 상위권 자연계 입시 재편 등 입시 지형 변화가 불가피할 것으로 보인다. 10일 열린 보건복지부의 보건의료정책심의위원회(보정심)에 따르면 2027학년도 의대 정원이 현행 3058명에서 490명 늘린 3548명으로 확정됐다. 2028·2029학년도에는 613명, 2030·2031학년도에는 813명씩 증원하기로 했다. [서울=뉴스핌] 정일구 기자 = 정부가 2027∼2031학년도 의과대학 정원을 오늘 확정한다. 보건복지부는 10일 오후 보건의료정책심의위원회(보정심) 제7차 회의를 열고 의대 정원 규모를 논의한 뒤 브리핑을 진행해 2027∼2031학년도 의사인력 양성 규모와 교육현장 지원 방안을 발표할 예정이다. 사진은 이날 서울시내 의과대학 모습. 2026.02.10 mironj19@newspim.com 2027학년도 증원분 490명은 비서울권 32개 의대를 중심으로 모두 지역의사제 전형으로 선발되며 해당 지역 중·고교 이력 등을 갖춘 학생만 지원할 수 있는 구조다. 입시업계는 이번 정원 확대가 '지역의사제' 도입과 맞물려 여러 학년에 걸쳐 입시 전반을 흔들 것으로 보고 있다. 이번 증원은 현 고3부터 중학교 2학년까지 향후 5개 학년에 영향을 미칠 것으로 분석된다. 특히 의대 정원 확대에 따른 합격선 하락이 예상된다. 종로학원 분석에 따르면 2025학년도 의대 정원 확대로 합격선 컷이 약 0.3등급 낮아졌으며, 이번 증원도 최소 0.1등급가량 하락을 불러올 것으로 보인다. 당시 지역권 대학의 경우 내신 4.7등급대까지 합격선이 내려오기도 했다. 합격선 하락은 상위권 학생들의 '반수'와 'N수생' 증가로 이어질 가능성이 크다. 임성호 종로학원 대표는 "의대 문턱이 낮아질 것이란 기대가 생기면 최상위권은 물론 중위권대 학생까지도 재도전에 나설 가능성이 커진다"고 전망했다. 특히 2027학년도 입시가 현행 9등급제 내신·수능 체제의 마지막 해라는 점에서 이미 내신이 확정된 상위권 재학생들이 반수에 나설 가능성도 제기된다. 지역의사제 도입은 중·고교 진학 선택에도 적지 않은 영향을 미칠 것으로 보인다. 지역전형 대상 지역의 고교에 진학해야 지원 자격이 주어지기 때문에 서울·경인권 중학생 사이에서는 지방 또는 경기도 내 해당 지역 고교 진학을 고려하는 움직임이 예상된다. 또 일반 의대와 지역의사제 전형 간 합격선 차이도 발생할 것으로 관측된다. 지원 단계부터 일반 의대를 우선 선호하는 경향이 강해 동일 학생이 두 전형에 합격하더라도 일반 의대를 택할 가능성이 높아 지역의사제 전형의 합격선은 다소 낮게 형성되고 중도 탈락률도 상승할 수 있다는 전망이 나온다. 전형 구조 측면에서도 변화가 예상된다. 김병진 이투스교육평가연구소 소장은 "490명 증원 인원 전체가 일반 지원자에게 해당되지는 않으며 지역인재전형과 일반전형으로 나눠 보면 실제 전국 지원자에게 영향을 주는 증원 규모는 약 200명 수준일 것"이라고 분석했다. 또 "최근 3년간 입시에서 모집 인원 변동에 가장 민감하게 반응한 전형은 수시 교과전형, 특히 지역인재전형이었다"며 "이번 증원에서도 교과 중심 지역인재전형의 모집 인원 증가 폭이 전체 입시 흐름을 결정할 것"이라고 전망했다.  hyeng0@newspim.com 2026-02-10 19:32
사진
알파벳 '100년물' 채권에 뭉칫돈 [뉴욕=뉴스핌] 김민정 특파원 = 인공지능(AI) 투자를 위한 실탄 확보에 나선 구글의 모기업 알파벳이 발행한 '100년 만기' 채권이 시장에서 뜨거운 반응을 얻었다. 100년 뒤에나 원금을 돌려받는 초장기 채권임에도 불구하고, 알파벳의 재무 건전성과 AI 패권에 대한 투자자들의 신뢰가 확인됐다는 평가다. 10일(현지시간) 블룸버그통신은 소식통을 인용해 알파벳이 영국 파운드화로 발행한 8억5000만 파운드(약 1조6900억 원) 규모의 100년 만기 채권에 무려 57억5000만 파운드의 매수 주문이 몰렸다고 보도했다. 이날 알파벳은 3년물부터 100년물까지 총 5개 트랜치(만기 구조)로 채권을 발행했는데, 그중 100년물이 가장 큰 인기를 끌었다. 알파벳은 올해 자본지출(CAPEX) 규모를 1850억 달러로 잡고 AI 지배력 강화를 위한 공격적인 행보를 이어가고 있다. 이를 위해 전날 미국 시장에서도 200억 달러 규모의 회사채 발행을 성공적으로 마쳤다. 강력한 수요 덕분에 발행 금리는 당초 예상보다 낮게 책정됐다. 또한 스위스 프랑 채권 시장에서도 3년에서 25년 만기 사이의 5개 트랜치 발행을 계획하며 전방위적인 자금 조달에 나섰다. 100년 만기 채권은 국가나 기업의 신용도가 극도로 높지 않으면 발행하기 어려운 '희귀 아이템'이다. 기술 기업 중에서는 닷컴버블 당시 IBM과 1997년 모토롤라가 발행한 사례가 있으며, 그 외에는 코카콜라, 월트디즈니, 노퍽서던 등 전통적인 우량 기업들이 발행한 바 있다. 기술 기업이 100년물을 발행한 것은 모토롤라 이후 약 30년 만이다. 미국 캘리포니아주 마운틴뷰의 구글.[사진=로이터 뉴스핌] 2026.02.11 mj72284@newspim.com ◆ "알파벳엔 '신의 한 수', 투자자에겐 '미묘한 문제'" 전문가들은 이번 초장기채 발행이 알파벳 입장에서는 매우 합리적인 전략이라고 입을 모은다. 얼렌 캐피털 매니지먼트의 브루노 슈넬러 매니징 파트너는 "이번 채권 발행은 알파벳 입장에서 영리한 부채 관리"라며 "현재 금리 수준이 합리적이고 인플레이션이 장기 목표치 근처에서 유지된다면 알파벳과 같은 기업에 초장기 조달은 매우 타당한 선택"이라고 평가했다. 그러면서 "알파벳의 견고한 재무제표와 현금 창출 능력, 시장 접근성을 고려할 때 100년 만기 채권을 신뢰성 있게 발행할 수 있는 기업은 전 세계에 몇 안 된다"고 강조했다. 하지만 투자자 입장에서는 신중해야 한다는 지적도 나온다. 초장기채는 금리 변화에 따른 가격 변동성(듀레이션 리스크)이 매우 크기 때문이다. HSBC은행의 이송진 유럽·미국 크레딧 전략가는 "AI 산업 자체는 100년 뒤에도 존재하겠지만, 생태계가 5년 뒤에 어떤 모습일지조차 예측하기 어렵다"며 "기업 간 상대적인 서열은 언제든 뒤바뀔 수 있다"고 꼬집었다. 실제로 금리 상승기에는 초장기채의 가격이 급락할 위험이 있다. 지난 2020년 오스트리아가 표면금리 0.85%로 발행한 100년 만기 국채는 이후 금리가 오르면서 현재 액면가의 30%도 안 되는 가격에 거래되고 있다. 이를 두고 슈넬러 파트너 역시 "투자자 입장에서 이 채권의 매력은 훨씬 미묘하고 복잡한 문제"라고 했다. mj72284@newspim.com 2026-02-11 01:35
기사 번역
결과물 출력을 준비하고 있어요.
종목 추적기

S&P 500 기업 중 기사 내용이 영향을 줄 종목 추적

결과물 출력을 준비하고 있어요.

긍정 영향 종목

  • Lockheed Martin Corp. Industrials
    우크라이나 안보 지원 강화 기대감으로 방산 수요 증가 직접적. 미·러 긴장 완화 불확실성 속에서도 방위산업 매출 안정성 강화 예상됨.

부정 영향 종목

  • Caterpillar Inc. Industrials
    우크라이나 전쟁 장기화 시 건설 및 중장비 수요 불확실성 직접적. 글로벌 인프라 투자 지연으로 매출 성장 둔화 가능성 있음.
이 내용에 포함된 데이터와 의견은 뉴스핌 AI가 분석한 결과입니다. 정보 제공 목적으로만 작성되었으며, 특정 종목 매매를 권유하지 않습니다. 투자 판단 및 결과에 대한 책임은 투자자 본인에게 있습니다. 주식 투자는 원금 손실 가능성이 있으므로, 투자 전 충분한 조사와 전문가 상담을 권장합니다.
안다쇼핑
Top으로 이동