8달러 ESP32-S3 마이크로컨트롤러에서 28.9M 파라미터 LLM을 성공적으로 구동함
Per-Layer Embeddings 기법을 활용하여 플래시 메모리에 모델 대부분을 저장, SRAM 제약 극복
9.5 토큰/초 속도로 온디바이스(On-device) 텍스트 생성, 서버 통신 없이 작동
이전 모델 대비 100배 많은 파라미터를 처리하며 임베디드 AI 가능성 제시
본 프로젝트는 Per-Layer Embeddings 아키텍처를 마이크로컨트롤러 환경에 성공적으로 적용한 사례로 주목받고 있습니다. 25M 파라미터 테이블을 느린 플래시 메모리에 저장하고, 각 토큰 생성 시 필요한 부분만 로드하는 방식으로 데이터 격리 아키텍처(Data Isolation Architecture)를 구현했습니다. 이는 제한된 512KB SRAM 환경에서 대규모 모델을 구동하기 위한 핵심 전략으로, 런타임 메모리 접근 패턴(Runtime Memory Access Pattern)을 최적화하여 실질적인 성능 향상을 이끌어냈습니다.
커뮤니티에서는 LLM 실행 시 발생하는 빈번한 플래시 메모리 읽기 작업이 칩의 수명에 미칠 영향에 대한 우려를 제기하고 있습니다. 일부 사용자는 수백만 번의 읽기/쓰기 주기를 견딜 수 있는지, 또는 데이터 미저장 정책(Zero-Retention Policy)과 같은 접근 방식이 플래시 수명에 어떤 영향을 미치는지에 대한 질문을 던졌습니다. 이에 대한 명확한 기술적 답변은 아직 부족하지만, 임베디드 시스템의 내구성(Embedded System Durability)은 중요한 고려 사항으로 논의되고 있습니다.
논의에서는 음성 인식(Voice-to-Text) 및 음성 합성(Text-to-Voice) 모델의 파라미터 크기가 20~30M 수준에 도달했다는 점을 언급하며, 본 기술이 실시간 대화형 디바이스 구현에 기여할 수 있음을 시사합니다. 예를 들어, 네트워크 연결 없이도 사용자와 상호작용하는 스마트 칫솔이나 기타 IoT 기기에서의 활용 가능성이 제기되었습니다. 이는 엣지 AI(Edge AI)의 발전과 함께 사용자 경험을 혁신할 잠재력을 보여줍니다.
일부 사용자는 ESP32-S3보다 더 강력한 Milk-V Duo와 같은 싱글 보드 컴퓨터(SBC)에서의 LLM 실행 가능성에 주목하고 있습니다. 이러한 보드는 더 많은 메모리(최대 256MB)와 TPU를 탑재하고 리눅스 환경을 지원하므로, 더 크고 복잡한 모델을 CPU 백엔드(CPU Backend)와 플래시 메모리 접근 패턴을 활용하여 실행할 수 있을 것이라는 기대가 있습니다. 이는 고성능 임베디드 AI 시스템 구축의 가능성을 열어줍니다.