{"node":{"id":12302,"uuid":"06aeb468-6c46-4e8a-bd0a-649dcb8ab0b4","title":"More GPUs or a Smaller Cache? Tensor Parallelism versus KV Compression for Memory-Bound LLM Serving","url":"https:\/\/xmt.pub\/index.php\/node\/12302","created":1787729420},"trust_level":"l0_aggregate","publisher":null,"source_url":"https:\/\/arxiv.org\/abs\/2608.23962","provenance":{"algorithm":"sha256(source_url|publisher_id|created)","stored":"326586cbde1e7e641ae03e342ec4303997af585ca083ff8514872f6536106fb1","expected":"326586cbde1e7e641ae03e342ec4303997af585ca083ff8514872f6536106fb1","status":"verified"}}