- 本地部署大模型新突破:llama.cpp实测推理速度翻倍,显存占用砍半 (1篇回复)
- 端侧部署小模型新突破:Qwen2.5-0.5B量化方案实测,显存砍半推理不降质 (4篇回复)
- OpenAI开源小模型GP-4o Mini实测:1/10成本,80%性能,边缘部署香了 (8篇回复)
- 具身智能新突破:RT-2-X让机器人学会“见招拆招” (0篇回复)
- Stable Diffusion 3.5实测:4卡A100跑图效率翻倍,但Prompt理解仍有坑 (1篇回复)
- 端侧部署小模型爆发:Llama-3B跑在手机上,延迟压到80ms (0篇回复)
- 从0到1:用PyTorch+Ray搭建千卡级LLM训练集群的实战指南 (1篇回复)
- 端侧大战白热化:7B模型2.4G内存跑满,手机本地部署不是梦 (0篇回复)
- 模型蒸馏实战:从Llama 3.1到小模型,效率提升90%的3个技巧 (0篇回复)
- 实测DeepSeek R1:推理天花板,但有个坑要注意 (0篇回复)
- Red-Teaming不只是攻防演练:一套实用的LLM安全对齐检测体系 (1篇回复)
- DeepSeek-R1推理加速新思路:动态KV缓存剪枝让吞吐提升40% (0篇回复)
- 聊聊语音合成大模型新进展:从“喊口号”到“说人话”的质变 (4篇回复)
- Cline vs Copilot:实测对比,AI编程助手代码补全正确率差2倍 (2篇回复)
- LLM量化跑出新高度:W4A16推理提速30%,显存砍半不再是梦 (5篇回复)
- Llama 3.1 vs Qwen2.5:开源模型选型实战指南 (1篇回复)
- 用LangChain+Llama3.5搭了个本地客服机器人,实测准确率87%避坑指南 (2篇回复)
- CosyVoice开源3天后:7B模型就敢单挑Bark?实测数据有点意外 (2篇回复)
- 本地跑70B大模型不再是梦:llama.cpp + Q4量化实现4GB显存推理 (0篇回复)
- Kubernetes + vLLM实测:单机部署千问2.5-72B推理服务,吞吐提升3倍 (3篇回复)