AI 모델 (LLM·GPT·Claude·Gemini)

GPT, Claude, Gemini, Llama 등 AI 모델(LLM) 출시·벤치마크·API 변경사항을 모읍니다.

AI 모델 관련 글 — 42 페이지

0
Gemma 4: 모든 면에서 가장 뛰어난 오픈 모델
구글 딥마인드가 추론 및 에이전트 워크플로우에 최적화된 차세대 오픈 모델 'Gemma 4'를 공개했습니다. Apache 2.0 라이선스로 제공되는 이 모델군은 모바일 기기용 경량 모델부터 고성능 워크스테이션용 대형 모델까지 다양한 크기를 지원하며, 멀티모달 및 긴 컨텍스트 처리 능력을 갖추고 있습니다.
Gemma 4: Byte for byte, the most capable open models↗deepmind.google
DeepMind Blog1개월 전공공지능 분석AI 모델
1
Gemini API의 비용과 신뢰성 균형을 맞추는 새로운 방법
구글 Gemini API가 비용 최적화를 위한 'Flex'와 높은 신뢰성을 위한 'Priority'라는 두 가지 새로운 서비스 티어를 출시했습니다. 개발자는 이제 단일 인터페이스 내에서 작업의 중요도에 따라 비용과 응답 속도를 정밀하게 제어할 수 있습니다.
New ways to balance cost and reliability in the Gemini API↗blog.google
Google AI Blog1개월 전공공지능 분석AI 모델
2
Data Scientist의 복수
LLM API의 등장으로 데이터 과학자의 역할이 축소될 것이라는 우려와 달리, 이들은 AI 시스템의 핵심 '하네스 엔지니어링', 즉 예측 모델의 평가, 디버깅, 지표 설계 등에서 필수적인 역할을 수행하며 '복수'할 것이라는 주장입니다. 특히, 추상적인 지표나 검증되지 않은 LLM 심판 대신 데이터 기반의 구체적인 문제 진단과 애플리케이션 특화 지표 개발이 중요해지고 있습니다.
The revenge of the data scientist↗hamel.dev
Hacker News1개월 전공공지능 분석AI 모델
3
M5 Pro 및 IOS를 위한 TurboQuant KV Compression 및 SSD Expert Streaming
SwiftLM은 Apple Silicon에 최적화된 초고속 Swift 추론 서버로, OpenAI 호환 API를 통해 MLX 모델을 서비스합니다. V2+V3 하이브리드 TurboQuant를 통해 KV 캐시를 FP16 대비 3.5배 압축하고, NVMe SSD에서 MoE 레이어를 직접 스트리밍하는 기술로 122B급 대규모 모델도 효율적으로 구동할 수 있습니다. iPhone에서도 MLX 모델을 직접 실행하는 iOS 앱을 제공하여 온디바이스 AI의 가능성을 확장합니다.
TurboQuant KV Compression and SSD Expert Streaming for M5 Pro and IOS↗github.com
Hacker News1개월 전공공지능 분석AI 모델
4
LLM 에이전트는 뇌뿐만 아니라 신경계도 필요하다.
이 기사는 LLM 에이전트의 오작동이 단순히 시스템 오류가 아닌 '행동적 퇴보(behavioral degradation)' 형태로 나타나며, 이를 감지하는 것이 중요하다고 강조합니다. 저자는 모델 출력의 이진적(Pass/Fail) 판단을 넘어, 세션 중 발생하는 범위 확장, 노이즈 증가, 환각 등 미묘한 이상 징후를 실시간으로 모니터링하는 두 가지 계층('세션 드리프트 모니터'와 '엔트로피 캡슐 엔진')을 제안합니다. 특히 공격적 도구(offensive tooling)에서 무단 행동의 위험성을 줄이기 위해 이러한 '신경계' 같은 모니터링 시스템이 필수적임을 역설합니다.
LLM Agents Need a Nervous System, Not Just a Brain↗dev.to
Dev.to1개월 전공공지능 분석AI 모델
5
22,000 토큰 세금: 내가 내 MCP 서버를 죽인 이유
이 글은 LLM 개발 초기 단계에서 작은 비용 절감보다는 탐색과 학습에 집중해야 하며, 실제 토큰 소비의 문제는 '컨텍스트 손실'로 인한 성능 저하에 있음을 강조합니다. 저자는 불필요한 MCP(Multi-Component Platform) 서버가 22,000 토큰을 소모하며 LLM 컨텍스트를 오염시키는 문제를 발견하고, 이를 7개의 단순한 `curl` 셸 스크립트로 대체하여 컨텍스트 효율성과 성능을 극대화한 경험을 공유합니다.
The 22,000 Token Tax: Why I Killed My MCP Server↗dev.to
Dev.to1개월 전공공지능 분석AI 모델
6
전문가 혼합
Mixture of Experts (MoE) 아키텍처는 LLM의 컴퓨팅 비용을 절감하는 잠재력을 가졌지만, 토큰 레벨 라우팅, 전문가 붕괴 방지, 막대한 VRAM 요구사항, 네트워크 통신 병목 등 복잡한 엔지니어링 과제를 수반합니다. 이는 인퍼런스 시 컴퓨팅에만 한정된 비용 절감이며, 전체 모델이 항상 메모리에 로드되어야 하므로 소규모 팀에는 큰 부담이 됩니다. 따라서 MoE는 단순한 해결책이 아니라 고도의 기술력과 자원을 요구하는 복잡한 트레이드오프의 게임입니다.
Mixture of Experts↗dev.to
Dev.to1개월 전공공지능 분석AI 모델
7
2026년 3월에 발표한 최신 AI 뉴스
구글이 2026년 3월, Gemini를 통해 단순한 챗봇을 넘어 사용자의 맥락을 이해하고 선제적으로 행동하는 '개인용 지능(Personal Intelligence)' 시대로의 전환을 가속화하고 있습니다. 검색, 지도, 워크스페이스 등 구글 생태계 전반에 AI를 깊숙이 통합하여 사용자 경험을 혁신하는 데 집중하고 있습니다.
The latest AI news we announced in March 2026↗blog.google
Google AI Blog1개월 전공공지능 분석AI 모델
8
Show HN: 1-Bit Bonsai, 최초의 상용화된 1-Bit LLMs
Prism ML이 세계 최초 상용화된 1-Bit LLM 'Bonsai'를 출시하며, 모바일 및 엣지 디바이스에서의 AI 실행 가능성을 혁신했습니다. 이 모델은 메모리, 속도, 에너지 효율을 대폭 개선하면서도 기존 모델과 유사한 성능을 제공하여, 온디바이스 AI 시대의 문을 열고 있습니다.
Show HN: 1-Bit Bonsai, the First Commercially Viable 1-Bit LLMs↗prismml.com
Hacker News1개월 전공공지능 분석AI 모델
9
TinyLoRA: 13개 파라미터로 추론 학습
TinyLoRA는 단 13개 파라미터(bf16 기준 26바이트)만을 사용하여 80억 파라미터 규모의 Qwen2.5 모델이 GSM8K 벤치마크에서 91%의 추론 정확도를 달성하는 획기적인 기술입니다. 이는 기존 LoRA의 한계를 넘어 최소 1개 파라미터까지 어댑터를 축소할 수 있으며, 강화 학습(RL)을 통해서만 이처럼 강력한 성능을 발휘합니다.
TinyLoRA – Learning to Reason in 13 Parameters↗arxiv.org
Hacker News1개월 전공공지능 분석AI 모델
10
HN: Cerno 공개 – 인간의 생물학적 특성 대신 LLM 추론을 겨냥한 CAPTCHA
Cerno는 인간의 생물학적 특성 대신 LLM 추론 능력에 도전하는 새로운 오픈소스 CAPTCHA 솔루션을 공개했습니다. 이 시스템은 미로 상호작용의 모터 제어 분석과 작업 증명, 스트룹 테스트, 평판 시스템 등 다단계 검증 파이프라인을 통해 정교한 봇을 효과적으로 차단합니다.
Show HN: Cerno – CAPTCHA that targets LLM reasoning, not human biology↗cerno.sh
Hacker News1개월 전공공지능 분석AI 모델
11
토큰당 300KB에서 69KB로: LLM 아키텍처가 KV Cache 문제를 어떻게 해결하는가
최근 LLM 아키텍처는 KV 캐시의 메모리 점유율을 획기적으로 줄여 추론 비용을 절감하고 있습니다. GPT-2의 토큰당 300KiB에서 Llama 3의 GQA (128KiB), DeepSeek V3의 MLA (68.6KiB) 같은 기술을 통해 메모리 사용량을 최소화하며, Mamba와 같은 새로운 모델은 아예 KV 캐시를 제거하기도 합니다. 이는 LLM의 운영 효율성과 접근성을 크게 향상시킬 것입니다.
From 300KB to 69KB per Token: How LLM Architectures Solve the KV Cache Problem↗news.future-shock.ai
Hacker News1개월 전공공지능 분석AI 모델
12
코히어(Cohere)가 오픈소스 기반의 최첨단 자동 음성 인식(ASR) 모델 '트랜스크라이브(Transcribe)'를 발표했습니다. 이 모델은 허깅페이스 오픈 ASR 리더보드에서 5.42%의 평균 단어 오류율(WER)로 1위를 기록하며 위스퍼 라지 v3 등을 능가하는 정확도를 보여줍니다. 한국어를 포함한 14개 언어를 지원하며, 생산 환경에 최적화된 설계와 아파치 2.0 라이선스로 제공됩니다.
코히어(Cohere)가 오픈소스 기반의 최첨단 자동 음성 인식(ASR) 모델 '트랜스크라이브(Transcribe)'를 발표했습니다. 이 모델은 허깅페이스 오픈 ASR 리더보드에서 5.42%의 평균 단어 오류율(WER)로 1위를 기록하며 위스퍼 라지 v3 등을 능가하는 정확도를 보여줍니다. 한국어를 포함한 14개 언어를 지원하며, 생산 환경에 최적화된 설계와 아파치 2.0 라이선스로 제공됩니다.
Cohere Transcribe: Speech Recognition↗cohere.com
Hacker News1개월 전공공지능 분석AI 모델
13
세 가지가 맞아떨어져야 했다: LLM 혁명 이면의 진짜 이야기
LLM 혁명은 갑자기 나타난 것이 아니라, 60년간의 연구와 우발적인 기술적 돌파, 그리고 세 가지 핵심 요소(트랜스포머 아키텍처, 방대한 데이터, GPU 하드웨어)가 2017년경 동시에 성숙하면서 가능해졌습니다. 과거의 챗봇과 검색 엔진이 가졌던 '망각 문제'와 '키워드 문제'를 트랜스포머의 '셀프 어텐션' 메커니즘이 해결하며 AI 언어 처리의 패러다임을 바꾼 것이 핵심입니다.
Three Things Had to Align: The Real Story Behind the LLM Revolution↗dev.to
Dev.to1개월 전공공지능 분석AI 모델
14
LLM용 TurboQuant 작동 방식과 RAM 사용량이 훨씬 적은 이유
LLM 스케일링의 주요 병목이 모델 크기/GPU에서 메모리 효율성으로 전환되며, 특히 추론 시 KV 캐시가 막대한 RAM을 소비합니다. TurboQuant는 숫자를 스케일과 정수 코드로 저장하고 어텐션 정확도를 유지하는 경량 교정 단계를 통해 기존 양자화보다 훨씬 적은 RAM으로 LLM을 효율적으로 운영하는 방법을 제시합니다. 이는 LLM 서비스의 비용과 속도 문제를 해결하는 핵심 기술입니다.
How TurboQuant Works for LLMs and Why It Uses Much Less RAM↗dev.to
Dev.to1개월 전공공지능 분석AI 모델
15
엉망진창인 AI 모델, 빠르게 수정하는 방법
Mush는 Wi-Fi, Ethernet, 5G 등 사용 가능한 모든 네트워크 인터페이스를 결합하여 다운로드 속도를 극대화하는 멀티 인터페이스 다운로드 엔진입니다. 파일을 여러 청크로 분할하여 병렬로 전송함으로써 단일 네트워크의 대역폭 한계를 극복하는 기술을 제공합니다.
Mush↗producthunt.com
Product Hunt1개월 전공공지능 분석AI 모델
16
가장 비용 효율적인 비디오 생성 모델인 Veo 3.1 Lite를 활용해 보세요
구글 딥마인드가 비용 효율성을 극대화한 비디오 생성 모델 'Veo 3.1 Lite'를 출시했습니다. 기존 Veo 3.1 Fast 모델 대비 비용을 50% 이상 절감하면서도 동일한 생성 속도를 제공하여, 대규모 비디오 애플리케이션 구축을 위한 경제적 토대를 마련했습니다.
Build with Veo 3.1 Lite, our most cost-effective video generation model↗blog.google
Google AI Blog1개월 전공공지능 분석AI 모델
17
Mr. Chatterbox는 빅토리아 시대의 윤리적으로 훈련된 model이다
트립 벤투렐라가 개발한 'Mr. Chatterbox'는 1837년에서 1899년 사이 영국 도서관의 저작권 만료 텍스트 28,000여 권(약 29.3억 토큰)으로만 학습된 빅토리아 시대 스타일의 언어 모델입니다. 이 모델은 3.4억 개의 매개변수로 GPT-2-Medium과 유사한 크기이며 로컬에서 실행 가능하지만, 현재로서는 대화 성능이 매우 제한적입니다. 하지만 저작권 문제가 없는 데이터로 LLM을 학습시킬 수 있다는 가능성을 보여주는 중요한 첫걸음으로 평가됩니다.
Mr. Chatterbox is a Victorian-era ethically trained model↗simonwillison.net
Hacker News1개월 전공공지능 분석AI 모델
18
Google의 2억 매개변수 시계열 파운데이션 모델, 16k 컨텍스트
구글 리서치가 2억 개의 매개변수를 가진 시계열 예측 파운데이션 모델 'TimesFM 2.5'를 공개했습니다. 이 모델은 기존 버전 대비 매개변수를 5억 개에서 2억 개로 줄이면서도 컨텍스트 길이는 16k까지 확장했으며, 연속적인 분위수 예측 기능을 추가했습니다. 이는 복잡한 시계열 데이터를 더욱 효율적이고 정확하게 분석하고 예측하는 새로운 기준을 제시합니다.
Google's 200M-parameter time-series foundation model with 16k context↗github.com
Hacker News1개월 전공공지능 분석AI 모델
19
Universal Claude.md – Claude 출력 토큰 절감
Anthropic Claude 모델의 출력 토큰을 최대 63%까지 절감할 수 있는 `CLAUDE.md` 파일을 소개하는 글입니다. 이 파일은 프로젝트 루트에 두기만 하면 Claude의 불필요한 서문, 미사여구, 형식적 발언, 장황한 코드 생성을 제거하여 더욱 간결하고 파싱하기 쉬운 응답을 유도합니다. 특히 자동화 파이프라인과 같이 높은 출력 볼륨을 가진 시나리오에서 비용 효율성을 크게 높일 수 있습니다.
Universal Claude.md – cut Claude output tokens↗github.com
Hacker News1개월 전공공지능 분석AI 모델
20
Ollama는 이제 Apple Silicon에서 MLX로 구동됩니다 (프리뷰)
Ollama가 2026년 3월 30일부로 Apple의 MLX 프레임워크를 통해 Apple Silicon에서 구동되는 프리뷰 버전을 공개했습니다. 이는 M5 칩셋의 GPU Neural Accelerators를 활용하여 Ollama 0.19 버전에서 기존 대비 최대 2배 빠른 성능(예: 디코드 속도 112 tokens/s)을 제공하며, NVFP4 지원 및 캐싱 개선으로 로컬 LLM 추론의 효율성과 품질을 크게 향상시킵니다.
Ollama is now powered by MLX on Apple Silicon in preview↗ollama.com
Hacker News1개월 전공공지능 분석AI 모델
21
Marginalia 검색용 NSFW 필터
Marginalia Search는 API 소비자를 위해 빠르고 CPU 친화적인 NSFW 필터를 개발 중이다. 최신 트랜스포머 모델은 속도 제약으로 배제하고, Fasttext로 시도했으나 학습 데이터의 편향 문제로 초기 성능이 미흡했다. 현재는 오픈소스 LLM을 활용해 수만 개의 샘플 데이터를 자동 라벨링하고, 이를 바탕으로 경량 모델을 구축하려는 실용적인 접근 방식을 택하고 있다.
An NSFW filter for Marginalia search↗marginalia.nu
Hacker News1개월 전공공지능 분석AI 모델
22
건설 문서 OCR은 작동하지 않지만, 우리가 고쳤습니다.
이 기사는 건축 도면에서 문을 자동으로 탐지하는 Anchorgrid의 새로운 OCR(Optical Character Recognition) API를 소개합니다. 무료 티어에서는 페이지당 2~4분, 유료 플랜에서는 전용 GPU 인프라를 통해 더 빠른 처리를 제공하여 건설 문서 처리의 비효율성을 해결하는 데 중점을 둡니다.
OCR for construction documents does not work, we fixed it↗getanchorgrid.com
Hacker News1개월 전공공지능 분석AI 모델
23
직접 쓰세요
이 글은 LLM을 활용한 문서 생성이 사고력 증진과 신뢰 구축의 기회를 박탈한다고 경고합니다. 진정한 글쓰기는 문제를 이해하고 해결하며, 자기 성장의 중요한 과정이므로 LLM은 보조 도구로 활용하되 핵심적인 사고는 인간이 직접 해야 한다고 강조합니다.
Do your own writing↗alexhwoods.com
Hacker News1개월 전공공지능 분석AI 모델