본문 바로가기

반응형

전체 글

(384)
스타크래프트를 직접 플레이하는 AI, Pluto를 소개합니다 안녕하세요,최근에는 AI가 사람을 대신해 다양한 작업을 수행하는 사례가 점점 늘어나고 있습니다. 이러한 변화는 게임 분야에서도 쉽게 확인할 수 있습니다. 특히 스타크래프트는 오랜 시간 사랑받아온 게임으로, 국내에서는 ‘전통놀이’라는 별명이 붙을 정도로 익숙한 작품입니다. 이번에 소개할 AI는 단순히 게임을 분석하거나 전략을 추천하는 AI가 아니라, 실제 스타크래프트 게임 안에서 직접 자원을 관리하고 유닛을 생산하며 전투까지 수행하는 AI입니다. 사람이 조작하지 않아도 스스로 게임 상황을 판단하고 플레이를 이어간다는 점이 특징입니다.이번 글에서는 스타크래프트를 직접 플레이하는 AI, Pluto에 대해 살펴보겠습니다.Pluto란Pluto는 StarCraft: Brood War를 플레이하기 위해 개발된 신경망..
텍스트를 생성하지 않는 AI, TypeSafe AI의 Jev를 소개합니다 안녕하세요,최근 생성형 AI 활용 방식에서도 새로운 접근이 등장하고 있습니다. 기존 대규모 언어 모델(LLM)이 자연어 문장 생성과 복잡한 질문 답변에 특화되어 있다면, TypeSafe AI가 공개한 Jev는 제한된 범위 내에서 빠르게 결론을 도출하고 구조화된 형태로 반환하도록 설계된 모델입니다. 긴 텍스트를 생성하는 대신 필요한 결정과 확률 정보를 직접 제공하기 때문에, 분류·라우팅·점수화와 같은 반복적인 판단 작업에서 처리 속도와 토큰 사용 효율을 높이는 것을 목표로 하고 있습니다. 이번 글에서는 이러한 새로운 형태의 AI 모델인 Jev가 무엇인지, 어떻게 작동하는지, 일반적인 LLM과 어떤 차이가 있는지 살펴보겠습니다.Jev란Jev는 TypeSafe AI가 2026년 9월 15일 공개한 첫 번째 S..
메타가 공개한 실시간 음성 인식 모델 'Muse Voice Transcribe'를 소개합니다 안녕하세요,메타가 공개한 실시간 음성 인식 모델 Muse Voice Transcribe가 스트리밍 전사 성능과 화자 분리 기능을 앞세워 주목받고 있습니다. 공개 당시 Artificial Analysis의 스트리밍 Speech-to-Text 평가에서 최상위권 성능을 기록했으며, 낮은 전사 지연과 함께 화자 분리, 발화 종료 감지, 다국어 처리 기능까지 하나의 모델에서 제공하는 것이 특징입니다.이번 글에서는 Muse Voice Transcribe가 어떤 모델인지부터 주요 특징과 벤치마크 성능, 사용 비용, 그리고 Meta Model API를 이용한 간단한 활용 방법까지 알아보겠습니다.Muse Voice Transcribe 란2026년 9월 1일, Meta는 실시간 음성 인식 및 오디오 인지(Audio Per..
[오픈소스 AI] NVIDIA Magpie-TTS : 한국어를 지원하는 다국어 TTS 모델 안녕하세요,최근 TTS(Text-to-Speech) 기술은 단순히 텍스트를 소리 내어 읽어주는 단계를 지나, 여러 언어와 다양한 화자의 음성을 얼마나 자연스럽게 재현하느냐가 핵심 과제로 떠오르고 있습니다. 특히 긴 문장을 합성할 때 흔히 나타나는 반복·누락 문제를 줄이고, 입력 텍스트를 음성으로 얼마나 정확하게 전달할 수 있는지가 모델 품질을 가르는 중요한 기준이 되고 있습니다. NVIDIA가 새롭게 공개한 MagpieTTS Multilingual v2607은 바로 이 지점에 초점을 맞춘 다국어 TTS 모델입니다. 한국어를 포함한 다국어 텍스트를 안정적이고 일관된 음성으로 합성하는 데 목적을 두고 있습니다. 이번 글에서는 MagpieTTS Multilingual이 어떤 모델인지 간략히 소개한 뒤, 주요 ..
[오픈소스 AI] 프런티어 모델과 경쟁하는 Qwen3.8-Max 모델을 소개합니다. 안녕하세요,중국 AI 기업들이 공개하는 오픈 가중치 모델은 규모와 성능을 빠르게 확장하며 기존 프런티어 모델과의 격차를 좁히고 있습니다. 그중 알리바바 Qwen 팀이 공개한 Qwen3.8-Max는 총 2조 4,000억 개의 매개변수를 갖춘 초대형 MoE 모델로, Qwen-Max급 모델의 가중치가 공개된 첫 사례입니다. 코딩과 연구 재현, 시각 추론, 컴퓨터 사용 등 여러 벤치마크에서 Fable 5와 GPT-5.6 Sol에 근접하거나 일부 항목에서 앞서는 결과를 기록하며 주목받았습니다.이번 글에서는 Qwen3.8-Max가 어떤 모델인지 살펴보고, 주요 특징과 벤치마크 성능, 라이선스에 대해 알아보겠습니다. 이어서 이 모델을 사용하는 방법도 함께 살펴보겠습니다. Qwen 3.8-Max란 2026년 8월 3일..
[오픈소스 AI] Kimi K3 공개, GPT·Claude와 경쟁하는 초대형 오픈 모델 안녕하세요,중국 AI 기업들이 공개하는 오픈 가중치 모델은 빠른 속도로 성능을 높이며, 기존 프론티어 모델과의 격차를 좁히고 있습니다. 그중 Moonshot AI가 공개한 Kimi K3는 코딩과 에이전트 작업, 웹 탐색, 업무 자동화 등 여러 평가에서 OpenAI와 Anthropic의 최상위 모델에 근접하거나 일부 항목에서 앞서는 결과를 기록해 주목받았습니다. 여기에 전체 모델 가중치까지 공개되면서, 프론티어급 성능을 목표로 한 초대형 모델을 직접 연구하고 배포할 수 있다는 점에서도 의미가 있습니다.이번 글에서는 Kimi K3가 어떤 모델인지 살펴보고, 주요 특징과 벤치마크 성능, 라이선스와 사용 비용, 공식 플랫폼부터 자체 배포까지 이어지는 간단한 활용 방법을 차례대로 정리해보겠습니다.Kimi K3 모..
글로벌 TTS 1위 Qwen-Audio-3.0-TTS, 중국 알리바바의 최신 AI 음성 합성 모델 안녕하세요,중국 알리바바가 공개한 TTS 모델이 글로벌 음성 합성 평가에서 최고 수준의 성능을 기록하며 주목받고 있습니다. Qwen-Audio-3.0-TTS-Plus는 사람의 청취 선호도를 바탕으로 평가하는 Artificial Analysis Speech Arena에서 1위에 올랐으며, 다국어 발음 정확도와 화자 음색 재현 성능에서도 경쟁력 있는 결과를 보여줬습니다.이번 글에서는 이 모델의 주요 특징과 벤치마크 성능, 사용 비용, 간단한 활용 방법에 대해 알아보겠습니다.Qwen-Audio-3.0-TTS 모델이란2026년 7월 21일, 알리바바는 최신 텍스트 음성 변환(Text-to-Speech, TTS) 모델인 Qwen-Audio-3.0-TTS를 공개했습니다. 입력된 텍스트를 자연스러운 음성으로 합성하며..
OpenAI GPT-5.6 모델 소개: 에이전트 성능, 코딩, 비용, 간단한 사용 예시 안녕하세요,AI 모델은 이제 단순히 질문에 답하거나 문장을 생성하는 도구를 넘어, 코드를 작성하고 자료를 조사하며 문서를 분석하고 여러 도구를 연결해 실제 업무를 수행하는 단계로 발전하고 있습니다. 특히 복잡한 작업일수록 모델의 추론 능력뿐 아니라 긴 맥락을 유지하는 능력, 도구 활용 방식, 처리 속도와 비용 효율성까지 함께 중요해지고 있습니다.이러한 흐름 속에서 OpenAI는 2026년 7월 9일 새로운 프런티어 모델 제품군인 GPT-5.6을 공개했습니다. GPT-5.6은 고난도 전문 업무를 위한 Sol, 성능과 비용의 균형을 고려한 Terra, 대규모 반복 작업에 적합한 Luna로 구성되며, 사용 목적과 예산에 따라 적절한 모델을 선택할 수 있도록 설계됐습니다.이번 글에서는 GPT-5.6이 어떤 모델..

728x90
반응형