AI重构
This commit is contained in:
@@ -11,7 +11,7 @@ main: binding port with default address family
|
||||
main: HTTP server is listening, hostname: 0.0.0.0, port: 8090, http threads: 15
|
||||
main: loading model
|
||||
srv load_model: loading model '/home/huangfukk/models/gguf/Qwen3/Qwen3-Embedding-4B/Qwen3-Embedding-4B-Q5_K_M.gguf'
|
||||
llama_model_load_from_file_impl: using device CUDA0 (NVIDIA GeForce RTX 4060 Ti) - 2767 MiB free
|
||||
llama_model_load_from_file_impl: using device CUDA0 (NVIDIA GeForce RTX 4060 Ti) - 15225 MiB free
|
||||
llama_model_loader: loaded meta data with 36 key-value pairs and 398 tensors from /home/huangfukk/models/gguf/Qwen3/Qwen3-Embedding-4B/Qwen3-Embedding-4B-Q5_K_M.gguf (version GGUF V3 (latest))
|
||||
llama_model_loader: Dumping metadata keys/values. Note: KV overrides do not apply in this output.
|
||||
llama_model_loader: - kv 0: general.architecture str = qwen3
|
||||
@@ -120,6 +120,7 @@ print_info: EOG token = 151663 '<|repo_name|>'
|
||||
print_info: EOG token = 151664 '<|file_sep|>'
|
||||
print_info: max token length = 256
|
||||
load_tensors: loading model tensors, this can take a while... (mmap = true)
|
||||
srv log_server_r: request: GET /health 127.0.0.1 503
|
||||
load_tensors: offloading 36 repeating layers to GPU
|
||||
load_tensors: offloaded 36/37 layers to GPU
|
||||
load_tensors: CUDA0 model buffer size = 2445.68 MiB
|
||||
@@ -220,7 +221,227 @@ How are you?<|im_end|>
|
||||
'
|
||||
main: server is listening on http://0.0.0.0:8090 - starting the main loop
|
||||
srv update_slots: all slots are idle
|
||||
srv operator(): operator(): cleaning up before exit...
|
||||
Received second interrupt, terminating immediately.
|
||||
| ||||