로컬 환경에서 LLM(거대 언어 모델)을 직접 구동하게 디면 “스크립트를 실행할 때마다 모델을 새로 로드해야 하는데, 이게 맞는 방식인가?” 7B 파라미터 모델 하나를 메모리에 올리는 데만 수십 초가 걸리고, 그 시간
1. Cloudflare Tunnel이란? ngrok 비교 Cloudflare Tunnel로 로컬 서버를 외부에 공개한다는 것은, 공인 IP나 포트 포워딩 없이 로컬 PC에서 실행 중인 서버를 인터넷에 안전하게 노출시키는 기술을 의미합니다. cloudflared 클라이언트가 Cloudflare의
Oracle Cloud Infrastructure(OCI) 무료 인스턴스에서 Permission denied (publickey) 오류로 SSH 접속이 막혔다면, 이 글이 가장 빠른 해결책을 제공합니다. Console Connection 생성, Cloud Shell 수정, 키 포맷 변경까지 모두 시도했지만 실패한
AI 모델을 한 번 돌릴 때마다 1~3분씩 하염없이 기다리는 시간, 정말 지루하죠. 특히 이것저것 프로젝트를 많이 벌여놓고 테스트하다 보면 로딩 속도 때문에 흐름이 다 끊기기 일쑤입니다. 게다가 여러 파이썬 프로그램에서
AI를 활용해 나만의 서비스를 구축하고 나면, 외부에서 내 AI 서비스에 접속할 수 있도록 만드는 것이 필수적입니다. 하지만 일반적인 클라우드 서비스는 무료 제공량에 한계가 있고, 유료 이용 시 매번 발생하는 비용이
사무실에서 영수증을 처리하거나 또는 상품을 구매하고 영수증 OCR 자동화를 구현하고 싶은데, 일반 OCR로는 표 구조가 뭉개지거나 상품명과 금액이 뒤섞여 제대로 된 결과를 얻지 못한 경험이 있으신가요? 이번 글에서는 비전언어모델(Vision-Language Model,
AI 개발환경을 구축할 때 가장 자주 겪는 문제는 “분명히 패키지를 설치했는데 모델이 실행되지 않는” (예: ChatTemplateLoadKwargs 오류 해결) 상황입니다. 에러 메시지는 ChatTemplateLoadKwargs, AllKwargsForChatTemplate, ImportError 같은 생소한 이름으로 가득하고, 원인을 찾아
거대 언어 모델(LLM)은 수십 GB에 달하고 그 AI 모델 파일은 일반적인 그래픽카드(GPU) 메모리에 담기엔 너무나 큽니다. 이때 필요한 것이 바로 양자화(Quantization)입니다. 특히 오늘 우리가 함께 알아볼 방식은 GPTQ 양자화(Generalized Post-Training
양자화 방식은 생각보다 훨씬 다양합니다. 보통 GPTQ, AWQ, GGUF가 현재 가장 대중적인 3대장인 것은 맞지만, 기술의 발전과 목적에 따라 새로운 방식들이 계속 등장하고 있습니다. 양자화(Quantization)란 무엇인가? 쉽게 비유하자면 ‘사진 용량을
클라우드 API를 통해 AI 모델을 사용하는 방식은 편리하지만, 데이터 프라이버시, 비용, 인터넷 연결 의존성이라는 세 가지 근본적인 한계를 가집니다. 특히 기업 내부 문서, 개인 정보가 담긴 데이터를 처리해야 하는 경우에는