알리바바의 인공지능 연구팀 Qwen이 멀티모달 Mixture-of-Experts(MoE) 모델 ‘Qwen3.8-Flash-Next’를 공개했다. 이 모델은 1250억 개 규모의 백본에 510억 개 N-gram 임베딩 테이블, 40억 개 멀티 토큰 예측 모듈을 결합한 구조로, 토큰당 실제로 활성화되는 파라미터는 60억 개 수준이다. Qwen팀은 이번 모델을 차기 세대인 Qwen4 아키텍처의 사전 공개판으로 소개했다.Qwen팀은 이번 모델이 토큰당 비용을 낮추는 데 초점을 맞췄다고 설명했다. 공개 자료에 따르면 Qwen3.8-Flash-Next는 기존 Qwen3.7-Plus 대비 학습 비용이 약 9분의 1 수준이다. 또 추론 효율을 높이기 위해 Gated DeltaNet과 Qwen Sparse Attention을 결합한 하이브리드 구조, Gated Residual, N-gram Embedding, Muon 옵티마이저 등 네 가지 변화를 적용했다.모델 규모는 크지만 실제 구동 방식은 희소 활성화에 가깝다. 공개된 설명에 따르면 이 모델은 총 512개 전문가를 두고, 토큰마다 10개 라우팅 전문가와 1개 공유 전문가를 활성화한다. 저장 용량은 FP8 체크포인트 기준 172.78GiB, BF16 기준 335.28GiB로 제시됐다. Qwen 측은 FP8 환경에서 GB300 기준 TP2가 최소 검증 구성이고, 8×H200 노드에서는 TEP8 사용을 권장한다고 밝혔다. 일반적인 TP8 구성은 체크포인트의 128단위 양자화 블록과 맞지 않는다고 설명했다.성능도 함께 공개됐다. Qwen팀은 DeepSWE 1.1에서 58.7점, SWE-bench Pro에서 62.5점, SWE-bench Multilingual에서 81.0점, LiveCodeBench v6에서 91.9점을 기록했다고 밝혔다. 멀티모달 항목에서는 AndroidWorld 84.5점, LVBench 76.6점, RealWorldQA 88.5점, MathVision 95.7점을 제시했다. 다만 일부 고난도 추론 과제에서는
Liquid AI가 온디바이스 AI 모델의 성능을 재현 가능하게 측정하는 오픈소스 벤치마킹 도구 ‘Pipette’를 공개했다. 이 도구는 모델 자체만이 아니라 양자화 방식, 실행 런타임, 기기 하드웨어를 하나의 묶음으로 보고 성능을 평가하는 것이 특징이다. 회사는 독립 검증을 위해 Artificial Analysis와 협력했다고 밝혔다.Pipette는 스마트폰이나 노트북 등 엣지 기기에서 AI 모델이 실제로 어떻게 동작하는지를 측정하는 데 초점을 맞췄다. 서버급 환경의 풀프리시전 조건에서 나온 모델 카드 수치가 모바일 환경의 실제 성능을 잘 반영하지 못한다는 문제의식에서 출발했다. Liquid AI는 온디바이스 성능이 개별 모델의 속성이라기보다, 모델·양자화·런타임·기기 조합의 결과라고 설명했다.이번에 공개된 데이터셋은 30개 이상의 모델과 여러 양자화 형식, macOS·iOS·Windows·Android용 llama.cpp 빌드, 256토큰부터 8,192토큰까지의 컨텍스트 길이를 포함해 1,000개가 넘는 조합을 담고 있다. 초기 검증 결과는 M5 Max가 탑재된 맥북 프로, 아이폰 17 프로, 갤럭시 S26 울트라에서 나왔다. AMD Ryzen AI Max+ 395와 Radeon 8060S 관련 결과는 추후 공개될 예정이라고 회사는 밝혔다.Pipette는 Apache 2.0 라이선스로 배포되며, 관리 도구인 pipette-mgmt, 클라이언트용 pipette-clients, 점수 집계용 pipette-scores와 공개 결과 데이터셋, 대시보드, iOS·안드로이드용 네이티브 벤치마크 앱을 함께 제공한다. 커뮤니티 제출 결과의 공개는 현재 베타 단계다.성능 평가는 고정된 토큰 형태, greedy decoding, 예열 구간 제외, 5회 반복 측정, 그리고 실행 전 열 상태와 부하 조건 확인 절차를 따른다. 품질 평가는 IFBench, GPQA Diamond, MATH-500 기준으로 별도 진행되며, 현재는 H100 80GB 시스템에서 수행한 llama.cpp
구글 리서치가 연속혈당측정(CGM) 데이터를 분석하는 경량 자기지도 학습 기반 모델 ‘글루코FM(GlucoFM)’을 공개했다. 이 모델은 혈당의 느린 변화와 짧은 변동을 각각 다른 흐름으로 나눠 학습하도록 설계됐으며, 당뇨 위험도와 인슐린 저항성, 베타세포 기능 이상, 식후 혈당 반응 예측 등 여러 대사 관련 과제에서 기존 모델보다 높은 성능을 보였다고 구글은 밝혔다.CGM은 피부 아래 삽입한 작은 센서로 수분마다 간질액 혈당을 측정해 공복, 야간, 식후 패턴을 연속적으로 보여준다. 다만 이런 데이터는 간격이 비거나 센서 잡음이 섞일 수 있고, 임상적으로 해석할 수 있는 정답 라벨은 확보가 어렵고 비용도 많이 든다. 구글은 이런 한계를 보완하기 위해 대규모 비라벨 CGM 데이터를 활용해 공통 표현을 학습하는 기초모델이 필요하다고 설명했다.글루코FM은 하루 단위 CGM 기록을 24시간, 5분 간격의 격자에 맞춰 정렬한 뒤 관측 여부를 함께 보존한다. 이후 낮은 주파수의 상태 성분과 짧은 이벤트 성분을 분리하는 이중 스트림 구조로 혈당 패턴을 학습한다. 단순히 원시 혈당값을 복원하는 대신, 잠재공간에서 다음 상태를 예측하는 방식으로 사전학습을 진행했고, 결측과 기기 특성을 반영한 증강도 적용했다.구글은 Wear-CGM 등에서 확보한 총 10만9066시간의 비라벨 CGM 데이터와 공개 데이터셋 4개를 합쳐 477명의 기록으로 모델을 사전학습했다고 밝혔다. 이후 CGMacros, 스탠퍼드, Hall, 상하이T2DM 등 4개 코호트에서 7개 임상 예측 과제를 평가했다. 그 결과 글루코FM은 14개 코호트-과제 조합에서 평균 PR-AUC가 가장 우수했으며, 같은 데이터로 사전학습한 강력한 비교 모델보다 평균 5.8%포인트 높았다고 설명했다. 특히 당뇨 위험도와 베타세포 기능 이상 평가에서는 모든 조합에서 가장 높은 PR-AUC를 기록했고, 인슐린 저항성 평가에서도 4개 중 3개에서 선두를 차지했다.식후 혈당 반응 예측에서도 성과가 확인됐다. 구글은 식사 전 1시간의 CG
엔비디아가 26일(현지시간) AI 인프라용 연결 기술인 NVLink Fusion에 맞춤형 고대역폭 메모리 ‘NVHBM’을 추가했다고 밝혔다. 엔비디아는 하이퍼스케일러와 AI 기업들이 반맞춤형 AI 인프라를 구축할 수 있도록 NVLink Fusion을 확장하고, 이를 통해 XPUs의 메모리 성능과 효율을 높이겠다고 설명했다.NVHBM은 엔비디아가 미래 GPU에 사용할 기술을 기반으로 하며, 기존처럼 XPU 다이에 메모리 컨트롤러를 두는 대신 HBM 베이스 다이에 엔비디아의 맞춤형 메모리 컨트롤러를 통합한 것이 특징이다. 엔비디아는 이 방식이 표준 HBM4E 대비 최대 30% 높은 메모리 대역폭과 15% 낮은 HBM 전력 소비를 제공하고, XPU 컴퓨트 다이 면적도 최대 25% 더 확보할 수 있다고 밝혔다.엔비디아는 NVHBM을 여러 메모리 공급업체가 제공할 수 있는 표준 구현 형태로 마련해, 고객사가 여러 공급사 메모리를 통합하고 검증하는 데 드는 공정을 줄이겠다고 했다. 이를 통해 NVLink Fusion 고객은 맞춤형 AI 칩을 더 빠르게 시장에 내놓을 수 있다고 설명했다.아마존의 애너푸르나 랩스는 NVLink Fusion과 관련한 엔비디아와의 협력의 일환으로 NVHBM 기술을 가장 먼저 검토하게 된다. 애너푸르나 랩스는 차세대 Trainium 칩, 특히 Trainium4부터 NVLink Fusion을 지원할 예정이며, 이를 통해 아마존 칩과 엔비디아 GPU가 공통 랙 규모 아키텍처에서 함께 작동할 수 있게 된다.엔비디아는 NVLink Fusion이 맞춤형 XPU와 CPU를 자사 랙 규모 플랫폼에 연결할 수 있도록 하는 개방형 구조라고 설명했다. 파트너들은 NVLink 칩렛, NVLink-C2C, NVLink 스위치, MGX 시스템과 랙, 그리고 CPU·ASIC·시스템 제조사·기술 제공업체 생태계를 활용할 수 있다.
구글 딥마인드는 20일(현지시간) 실시간 음성 인식용 새 모델 ‘제미나이 3.5 트랜스크라이브(Gemini 3.5 Transcribe)’를 공개했다고 밝혔다. 이 모델은 배경 소음, 전문 용어, 말더듬 등 기존 음성 인식 모델이 처리하기 어려웠던 요소를 반영해 음성을 정확하고 정돈된 텍스트로 바꾸도록 설계됐다.구글 딥마인드에 따르면 제미나이 3.5 트랜스크라이브는 원시 음성을 직접 받아들여 정확한 문장과 형식의 텍스트로 변환한다. 또 자연스러운 말투와 의도를 파악하고, 사용자 맞춤 어휘도 인식할 수 있도록 만들어졌다. 라이브 언어 전환과 스트리밍 전사 기능을 지원하며, 여러 화자가 있는 대화에서는 화자 구분과 단어 단위 시간표시도 제공한다.이 모델은 구글 AI 스튜디오의 제미나이 API와 제미나이 엔터프라이즈 에이전트 플랫폼에서 사용할 수 있다. 개발자는 이를 활용해 음성 에이전트, 실시간 자막 도구, 통화 후 분석 파이프라인 등을 구축할 수 있다고 회사는 설명했다.구글 딥마인드는 제미나이 3.5 트랜스크라이브가 이전 전사 모델인 ‘치프 3(Chirp 3)’보다 성능이 향상됐다고 밝혔다. 외부 평가기관 Artificial Analysis 기준으로 최종 전사까지 걸리는 시간은 70% 개선됐고, FLEURS 벤치마크에서는 스트리밍 모드 기준 단어 오류율(WER) 5.50%, 비스트리밍 사용 사례에서 5.04%를 기록했다고 전했다.이 모델은 구글의 일부 제품에도 적용되고 있다. 회사는 제미나이 앱과 안드로이드에서 이미 음성 기능에 활용되고 있으며, 맥OS용 제미나이 앱에서도 사용할 수 있다고 밝혔다. 또 Gboard, 안드로이드용 Rambler, 크롬, 구글 Antigravity 등에서도 문맥을 반영한 전사와 편집 기능을 지원한다고 설명했다.
IBM이 오픈형 추론 언어모델 패밀리 ‘그라나이트 4.2(Granite 4.2)’를 25일 공개했다. 이번 모델은 3B, 8B, 30B 파라미터 규모로 출시됐으며, 기존의 지시 수행형 모델과 달리 명시적 추론 기능을 중심으로 설계됐다.IBM에 따르면 그라나이트 4.2의 모든 모델은 답변 전 사고 과정을 출력할 수 있고, 추론 여부를 전환하는 스위치와 간단한 질문에 짧은 추론 예산만 쓰는 저비용 모드도 제공한다. 세 모델 모두 아파치 2.0 라이선스로 배포돼 다운로드, 미세조정, 상업적 활용이 가능하다.이번 모델은 디코더 전용의 밀집형 트랜스포머 구조를 채택했으며, 약 15조 토큰으로 처음부터 사전학습됐다. 이후 다단계 강화학습을 거쳤고, 8B와 30B 모델에는 코드 수정, 터미널 조작, 웹 검색을 실제 샌드박스 환경에서 수행하도록 학습하는 에이전틱 RL 단계가 포함됐다. 3B 모델은 기초 RL과 정렬 단계만 적용됐다.IBM은 3B, 8B, 30B 외에 4억7000만개 파라미터 규모의 ‘그라나이트 스피치 5.0 터보 CTC’ 모델 2종도 함께 공개했다. 이 음성 모델은 LLM 백본 없이 CTC 방식으로 음성을 텍스트로 변환하며, IBM은 단일 H200에서 약 1만2600 수준의 실시간 처리 성능을 제시했다.그라나이트 4.2는 그룹드 쿼리 어텐션, RoPE, SwiGLU MLP, RMSNorm 등을 사용하며, 3B는 40개 층과 2560 임베딩 크기, 8B는 40개 층과 4096 임베딩 크기, 30B는 64개 층과 3만2768 크기의 MLP 은닉층을 갖는다. IBM은 NeMo-RL과 NeMo-Gym을 활용해 코어위브의 NVIDIA GB200 NVL72 클러스터에서 학습을 진행했다고 밝혔다.
카카오페이가 2026년 2분기 연결 매출 3351억원을 기록하며 영업이익이 586억원으로 6.3배 증가하는 성과를 올렸다. 이는 금융 서비스의 급성장 덕분으로, 금융 매출 비중이 처음으로 50%를 넘었다. 특히, 카카오페이는 결제 서비스와 금융 서비스에서 각각 13% 및 75%의 매출 증가를 보이며, 오프라인 결제 이용자 수가 600만명을 초과하는 등 긍정적인 성과를 이어가고 있다. 신원근 카카오페이 대표는 데이터 기반 맞춤형 서비스와 자회사 운영 효율화가 수익성 개선에 기여했다고 밝혔다.한편, 중소벤처기업부는 온라인 플랫폼을 대상으로 한 '상생협력법' 개정안을 발의하여 플랫폼과 입점업체 간의 불공정 거래를 조사할 수 있는 법적 근거
최근 인공지능(AI) 분야에서 에너지 효율성과 대화형 모델의 혁신이 주목받고 있다. 텍사스 대학교의 리지 K. 존 교수는 전통적인 신경망의 복잡성을 줄이고 에너지 소비를 획기적으로 낮출 수 있는 '무게 없는 신경망(weightless neural networks)'을 개발하고 있다. 이 모델은 입력값을 반복적으로 곱하는 대신, 이진 입력을 상호 연결된 조회 테이블을 통해 처리하여 최대 1,000배 더 작고 빠르며 비슷한 정확도를 유지할 수 있다. 이러한 기술은 의료 모니터링, 활동 추적 등 다양한 분야에 적용될 수 있으며, 향후 챗봇과 같은 대규모 모델에도 적용될 가능성이 있다.한편, PolyAI는 새로운 오디오 네이티브 대화 모델인 'Dialog-RSN-1'을 출시했다. 이 모델은 사용자의 음성을 직접 인식하여 대화의 흐름을 자연스럽게 처리하며, 300ms 이하의 응답 속도를 자랑한다. Dialog-RSN-1은 특히 레스토랑 예약, 보험 청구 등 다양한 산업에서 활용될 수 있으며, 기존의 대화형 AI 모델과는 차별화된 성능을 보여준다.구글 딥마인드는 'Gemini Robotics 2'라는 새로운 로봇 모델을 출시하여 전체 신체 제어, 손가락의 섬세한 조작, 다중 로봇 협업을 가능하게 했다. 이 모델은 로봇이 예측 불가능한 환경에서도 적응할 수 있도록 설계되었으며, 다양한 작업을 수행할 수 있는 능력을 갖추고 있다. 특히, Gemini Robotics 2는 로봇 간의 협업을 통해 복잡한 작업을 효율적으로 수행할 수 있는 가능성을 제시하고 있다.이러한 기술들은 AI의 에너지 효율성을 높이고, 대화형 AI의 자연스러운 상호작용을 개선하며, 로봇의 다기능성을 강화하는 데 기여하고 있다. 앞으로 이러한 혁신들이 AI 기술의 발전에 어떤 영향을 미칠지 주목된다.
국가인공지능전략위원회가 인공지능 데이터센터(AIDC)를 국가 AI 인프라 산업으로 발전시키기 위해 공급망의 병목 요인을 점검하고 산업 생태계 강화 방안을 모색했다. 14일 서울스퀘어에서 열린 'AI 데이터센터 산업생태계 육성 간담회'에서는 AIDC의 적기 공급이 국가 AI 경쟁력의 핵심 과제라는 데 참석자들이 공감하며, 산업 생태계 육성에 적극 협력하기로 했다.조준희 산업AX·생태계 분과위원장은 AI 데이터센터가 단순한 GPU 집합체를 넘어 전력설비, 첨단 냉각기술, 건설 역량이 결합된 종합 인프라로서 글로벌 AI 3강 도약의 핵심 동력이라고 강조하며, 국내 기술 자립과 산업 생태계 조성을 통해 수출을 확대하고 글로벌 시장을 주도할 수 있도록 지원하겠다고 밝혔다.이번 간담회는 정부가 발표한 '3대 메가프로젝트'의 일환으로, 반도체, 피지컬 AI, AI 데이터센터를 주요 축으로 삼고 있다. 참석자들은 AIDC 운영에 필수적인 전력, 냉각, 부지 등 핵심 인프라 확충 방안에 집중하고, 데이터센터 구축에 필요한 국내 부품 및 설비 산업의 동반 성장과 수출 산업화 가능성에 대해서도 논의했다.또한, 세제 지원과 규제 완화 등 정부 차원의 제도 개선 방향에 대한 의견도 교환되었다. 참석자들은 피지컬 AI와 에이전틱 AI의 확산으로 컴퓨팅 자원 수요가 급증할 것으로 예상하며, AIDC의 적기 공급이 국가 AI 경쟁력을 좌우할 것이라는 점에 의견을 모았다.
최근 AI 칩 시장에서 Nvidia의 지배력이 약화되고 있는 가운데, Microsoft가 AMD와의 파트너십을 확대하고 있습니다. Microsoft는 Azure 클라우드에서 AMD의 새로운 Helios 플랫폼을 활용할 계획이며, 이는 대규모 AI 모델을 실행할 수 있도록 설계되었습니다. AMD의 CEO 리사 수는 이번 파트너십을 중요한 이정표로 평가하며, Microsoft의 CEO 사티아 나델라는 고객들이 AI 인프라에 대한 더 많은 선택권을 필요로 한다고 언급했습니다. 또한, AMD는 AI 모델 개발사인 Anthropic과의 협업 가능성도 제기되고 있어, Nvidia의 시장 지배력에 도전하는 새로운 경쟁 구도가 형성되고 있습니다.한편, 미국 정부는 중국 AI 모델에 대한 규제를 강화하고
최근 AI 기술의 발전이 다양한 분야에서 주목받고 있지만, 그 한계와 도전 과제가 여전히 존재하고 있다. Epoch AI의 연구에 따르면, 인기 있는 AI 텍스트 탐지기들이 특정 작가의 스타일을 모방한 AI 생성 텍스트를 식별하는 데 어려움을 겪고 있다는 사실이 밝혀졌다. 연구팀은 Pangram, GPTZero, Originality.ai와 같은 탐지기들이 일반적인 AI 생성 텍스트를 거의 완벽하게 식별할 수 있지만, 특정 작가의 스타일을 모방한 경우에는 평균 13%의 텍스트가 탐지되지 않는다고 보고했다. 특히, 과학적 글쓰기에서 이 탐지기들은 24%에서 29%의 오류율을 보이며, 교육 환경에서의 신뢰성에 대한 우려를 낳고 있다.한편, 의료 분야에서도 AI의 신뢰