4317 Commits (aa25aff10d1ccc6dd4e85952678d63946bdf89dc)
 

Author SHA1 Message Date
Patrick Devine aa25aff10d
client: add request signing to the client (#10881) 1 year ago
Jesse Gross ea79003180 kvcache: Skip computing causal mask for worst case graph reservation 1 year ago
Kyle Steere 9239a254e0
server: abort download on empty digest 1 year ago
Parth Sareen 066d0f4746
tools: relax JSON parse constraints for tool calling (#10872) 1 year ago
Parth Sareen aea6fb9b58
tools: remove newline stripping (#10869) 1 year ago
RAPID ARCHITECT 012cf65340
readme: add AWS Strands Agents SDK example to community integrations (#10865) 1 year ago
Min Yoo a45231af47
readme: Add macLlama to community integrations (#10790) 1 year ago
Daniel Hiltgen 2307fc2bcd
tests: drop llama3.2-vision embedding tests (#10837) 1 year ago
frob 6623898198
docs: remove unsupported quantizations (#10842) 1 year ago
frob eda472df1b
server: add hint to the error message when model path access fails (#10843) 1 year ago
Jesse Gross f18e0cb550 ml: Improve slog formatting for BackendMemory 1 year ago
Parth Sareen e8b981fa5d
tools: refactor tool call parsing and enable streaming (#10415) 1 year ago
Parth Sareen 884d26093c
llama: add minimum memory for grammar (#10820) 1 year ago
Jesse Gross 1f371ea92f ml: Panic rather than return error on tensor allocation failure 1 year ago
Jesse Gross 73d6a82cce ollamarunner: Memory usage reporting 1 year ago
Jesse Gross 6db8a3771c ggml: Report graph memory for failed allocations 1 year ago
Daniel Hiltgen d950ff12c0
sched: fix runner leak during reloading unload (#10819) 1 year ago
Michael Yang adff143bcd
fix: mllama quality (#10807) 1 year ago
Bruce MacDonald fbe6ae285a
server: improve tensor quantization fallback logic (#10806) 1 year ago
Daniel Hiltgen fdd4d479a3
integration: add qwen2.5-vl (#10815) 1 year ago
Michael Yang 61aeaf7e81
remove support for multiple ggufs in a single file (#10722) 1 year ago
Daniel Hiltgen 7359b02707
win: detect background upgrade in progress (#10785) 1 year ago
Michael Yang c890011322
feat: port qwen2 model (#10782) 1 year ago
Michael Yang e0ed984cde
feat: qwen3 dense and sparse models (#10708) 1 year ago
Michael Yang 139f84cf21
fix cmakelists (#10804) 1 year ago
Michael Yang 375839ea2d
chore: disable debug in binary libraries (#10788) 1 year ago
Michael Yang 69b2fe9282
fix: qwen25vl assign samebatch in multimodal input (#10789) 1 year ago
Michael Yang 9ed8bf14cb
ml: add more rope options (#10775) 1 year ago
DarkCaster e6a800ca11
llama: fix incorrect initialization of C.struct_common_sampler_cparams.penalty_present (#10779) 1 year ago
Michael Yang ff180c3466
fix llama and mistral3 models (#10774) 1 year ago
Jesse Gross 3fe74fba42 llm: Use first layer as memory buffer in estimation 1 year ago
Daniel Hiltgen 1a0cfd080a
avoid kv truncation during create (#10761) 1 year ago
Jesse Gross 94ab428e3f ggml: Seperate tensor load from backend creation 1 year ago
Jesse Gross d755577473 llm: Estimate projector memory correctly for Ollama engine 1 year ago
Jesse Gross a2cc8571c5 llm: Consistently track unassigned model data 1 year ago
Ronald Wilson 7edfdd2f5f
readme: add TinyNotepad to community integrations (#10763) 1 year ago
Michael Yang 333e360422
model: handle multiple eos tokens (#10577) 1 year ago
Daniel Hiltgen 27da2cddc5
Fix lingering Q4_0 help reference (#10720) 1 year ago
Bruce MacDonald feb8923ada
cmd: add ellipses to truncated show metadata (#10717) 1 year ago
Jesse Gross fe623c2cf4 ollamarunner: Multi-modal worst case graph 1 year ago
Jesse Gross 3c14461d5d ollamarunner: Separate text and multimodal graphs 1 year ago
Jesse Gross 499ae7311f ollamarunner: Base cached tokens on current prompt 1 year ago
Michael Yang ef202789fa
fix pixel values padding (#10718) 1 year ago
Michael Yang 55760195e6
fix mllama conversion (#10716) 1 year ago
Bruce MacDonald bd68d3ae50
ggml: update qwen25vl vision size estimate (#10711) 1 year ago
Daniel Hiltgen ff80718e9c
fix crash in old clients with quantization progress (#10710) 1 year ago
Bruce MacDonald 0aa8b371dd
model: add Qwen2.5-VL support (#10385) 1 year ago
Michael Yang 23125648b8
chore: update mllama to use ollama engine (#10637) 1 year ago
tej 0478d440f0
Fixed over vram allcation dure to small initial layer sizes. 1 year ago
Parth Sareen 8cc33f4c2b
llama: fix memory leak for grammar (#10696) 1 year ago