001[TUTORIAL]
llama.cpp prompt lookup 42배, 로컬 LLM 속도 오해 2가지 제대로 짚기
llama.cpp에서 '42배 빨라졌다'는 소문이 돌았지만, 원문 PR과 원저자 리포트를 대조해 보니 병합 여부와 속도 범위가 부풀려져 있었습니다. 실제로 무엇이 바뀌었는지, 로컬 LLM 실무에서 쓸 만한 부분과 플래그 사용법, 한국어 적중률, 도입 전 확인할 점까지 정리했습니다.
2 views#speculative decoding#로컬 LLM 속도