gpu-services

Author	SHA1	Message	Date
Hyungi Ahn	cc792eddbb	feat: MLX /status API 통합 — GPU 무접촉 부하 측정 - model_adapter.status_check(): GET /status, 미지원 백엔드는 None - backend_registry.get_load_status(): /status API 1순위, hybrid fallback - active_jobs >=4 매우 바쁨, >=2 바쁨, =1 보통, =0 여유 - source: status_api \| hybrid 표시 - worker._build_system_status(): source별 분기, active_jobs/total_requests 표시 - hybrid 경로의 self-job 제외 (active > 1) - health loop에서 status도 같이 캐시 (지원 백엔드만) Mac mini /opt/mlx-proxy.py에 active_jobs 카운터 + /status 엔드포인트 추가됨 Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>	2026-04-07 08:06:44 +09:00
Hyungi Ahn	875a4f80d2	feat: Hybrid 부하 판단 — health latency baseline + 조건부 inference - model_adapter: measure_inference_latency() (max_tokens=1, 최소 부하) - backend_registry: - health latency baseline 학습 (초기 5회 max, 이후 EMA) - get_load_status(): inference 우선, health/queue 보조 - cache 30s + cooldown 10s + asyncio.Lock으로 자기증폭 루프 방지 - 조건: health > baseline*3 또는 사용자 명시 요청 시에만 ping - worker: - "system_status" 액션 — 사용자 상태 조회 시 force_measure - _build_system_status() 응답 빌더 (health/baseline/ping/queue) - route busy 안내를 get_load_status 기반으로 변경 Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>	2026-04-07 07:46:57 +09:00
Hyungi Ahn	a16ff2ea88	fix: max_tokens 추가 — Gemma 16000, EXAONE 4096 응답이 중간에 끊기는 문제 해결. ModelAdapter에 max_tokens 파라미터 추가, stream/complete 양쪽 payload에 반영. Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>	2026-04-06 12:52:31 +09:00
Hyungi Ahn	21f6869898	feat: EXAONE 분류기 — direct/route/clarify 라우팅 + 대화 기억 - EXAONE: 분류기+프롬프트엔지니어+직접응답 (JSON 출력) - 간단한 질문은 EXAONE이 직접 답변 (파이프라인 스킵) - 복잡한 질문은 AI 최적화 프롬프트로 Gemma에 전달 - 모호한 질문은 사용자에게 추가 질문 (clarify) - user별 최근 대화 기억 (최대 10개, 1시간 TTL) - ModelAdapter: messages 직접 전달 옵션 추가 Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>	2026-04-06 12:40:39 +09:00
Hyungi Ahn	9f0c527442	fix: health_check timeout 3→5초 — MLX cold start 대응 Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>	2026-04-06 12:08:28 +09:00
Hyungi Ahn	c4c32170f1	feat: NanoClaude Phase 2 — EXAONE→Gemma 파이프라인, 큐, 상태 API - ModelAdapter: 범용 OpenAI-compat 어댑터 (stream/complete/health) - BackendRegistry: rewriter(EXAONE) + reasoner(Gemma4) 헬스체크 루프 - 2단계 파이프라인: EXAONE rewrite → Gemma reasoning (SSE rewrite 이벤트 노출) - Fallback: 맥미니 다운 시 EXAONE 단독 모드, stream 중간 실패 시 자동 전환 - Cancel-safe: rewrite 전/후, streaming loop 내, fallback 경로 모두 체크 - Rewrite heartbeat: complete_chat 대기 중 2초 간격 processing 이벤트 - JobQueue: Semaphore(3) 기반 동시성 제한, 정확한 queue position - GET /chat/{job_id}/status, GET /queue/stats 엔드포인트 - DB: rewrite_model, reasoning_model, rewritten_message 컬럼 추가 Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>	2026-04-06 12:04:15 +09:00

6 Commits