智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
全部 AI AI开发实战 FastAPI/Flask LangChain/AutoGPT LoRA/QLoRA Milvus/Qdrant React/Vue asyncio 学习笔记 容器化部署 开发实战 开源推荐 技术博客 技术选型 提示词工程 检索增强生成 版本控制 踩坑记录
LoRA微调7B大模型:从数据准备到推理效果对比完整记录

LoRA微调7B大模型:从数据准备到推理效果对比完整记录

本文记录了使用LoRA/QLoRA技术微调Qwen2.5-7B-Instruct的完整过程。在单张RTX 4090 24GB上,通过4-bit量化+LoRA将显存占用从OOM降到14.2GB,训练集8000条,3个epoch耗时约4.5小时。最终loss从初始1.87降至0.52,在100条测试集上相比原始模型准确率从61%提升到89%。文中包含完整可运行代码、踩坑记录和真实效果对比。

小唐LabLab 1 0 0 1小时前
LoRA微调7B大模型:从数据准备到推理效果对比的完整落地记录

LoRA微调7B大模型:从数据准备到推理效果对比的完整落地记录

本文记录了我在单张24GB显存环境下,用LoRA和QLoRA微调Qwen2.5-7B-Instruct的全过程。训练数据约1.2万条中文指令样本,LoRA rank设为16、alpha为32,QLoRA采用4bit NF4量化。相比全量微调,显存占用从约80GB降到9.6GB,训练约4.5小时完成3个epoch。文中包含可运行代码、loss曲线分析、推理效果对比以及踩坑经验,适合想低成本微调7B模

清晨寻光 3 0 0 3小时前
Docker Compose编排多服务容器化部署与健康检查实践

Docker Compose编排多服务容器化部署与健康检查实践

一个真实项目从单机docker run迁移到Docker Compose编排的完整记录。项目包含Nginx、Spring Boot、MySQL 8.0、Redis 7.2四个服务,通过自定义bridge网络实现服务隔离,用命名卷持久化数据,借助healthcheck与depends_on的condition参数解决启动顺序问题。迁移后部署耗时从12分钟降至90秒,服务启动成功率从78%提升到99.

机器学习研究笔记 4 0 0 7小时前
FastAPI+Flask接口从2.3s降到180ms:一次真实的性能调优记录

FastAPI+Flask接口从2.3s降到180ms:一次真实的性能调优记录

线上一个查询接口P95响应时间飙到2.3秒,QPS一过50就开始大量超时。本文记录了完整的排查过程:用py-spy和cProfile定位到瓶颈在N+1查询和重复的序列化开销,通过selectinload改写ORM查询、引入Redis两级缓存、调整Gunicorn worker配置,最终把P95压到180ms,单机QPS从50提升到420。文中附压测数据和可复现代码。

长期关注品牌实践笔记 12 1 0 9小时前
Docker Compose编排多服务容器化部署:网络、卷挂载与健康检查配置详解

Docker Compose编排多服务容器化部署:网络、卷挂载与健康检查配置详解

本文以一个真实的前后端分离项目为例,分享如何用Docker Compose编排Nginx、Spring Boot、MySQL 8.0和Redis 7四个服务。通过自定义bridge网络实现服务隔离,利用命名卷持久化数据,配置健康检查与depends_on条件控制启动顺序,最终将部署时间从手动操作的25分钟压缩到90秒内,服务启动成功率达到99%以上。

计算机视觉工程手记 9 2 0 10小时前
RAG检索增强生成优化:chunk策略、embedding切换与rerank效果对比

RAG检索增强生成优化:chunk策略、embedding切换与rerank效果对比

本文记录了一个真实RAG系统(检索增强生成)的优化过程。原始方案在2000条FAQ数据上召回率仅61%,通过调整chunk策略(512→256滑动窗口)、切换embedding模型(text-embedding-ada-002→bge-large-zh-v1.5)、引入bge-reranker-large重排序,最终Top-3召回率提升至89%,MRR从0.52升至0.81,端到端响应延迟从1.2

深夜开源工作台 10 2 0 10小时前
从零手写AI Agent:LangChain工具调用、记忆管理与循环控制

从零手写AI Agent:LangChain工具调用、记忆管理与循环控制

LangChain 0.3和AutoGPT虽然好用,但很多开发者说不清Agent内部的循环到底怎么跑。我用300行Python手写了一个最小可用的AI Agent,基于OpenAI gpt-4o-mini,跑通了工具定义、对话记忆、异常重试和步数上限控制。实测在3个常见任务上,平均2.3轮完成,token消耗比裸调LLM多约40%。本文把每一处实现细节拆开讲清楚。

日志拒绝内耗观察员 4 0 0 12小时前
Milvus 与 Qdrant 向量数据库选型对比:千万级向量场景部署、性能与资源实测

Milvus 与 Qdrant 向量数据库选型对比:千万级向量场景部署、性能与资源实测

在图文去重与语义检索业务中,我们需要在 Milvus 2.4.9 与 Qdrant 1.9.2 之间做选型。实测 1200 万条 768 维向量,在 8C32G 单机、100 并发下,Qdrant 的 P95 查询延迟约 18ms,Milvus 约 29ms;但 Milvus 在批量写入和标量过滤组合查询上更稳。本文给出 Docker 部署、建表、查询代码、压测数据与踩坑记录,帮助你按业务场景做决

一线自动化小站 17 2 0 14小时前
FastAPI+Flask双框架API性能调优:从2.3s到180ms的profiling、SQL与缓存改造

FastAPI+Flask双框架API性能调优:从2.3s到180ms的profiling、SQL与缓存改造

一个日请求量约80万的商品详情接口,P99从2.3s降到180ms,服务器从8台减到3台。本文用py-spy火焰图定位到ORM的N+1查询,配合索引重写、Redis两级缓存和连接池调参,附完整代码与wrk压测对比数据。FastAPI 0.110和Flask 3.0两个版本都跑了一遍,结论略有差异。

缓存拒绝内耗工程日常 4 0 0 14小时前
LoRA微调7B大模型:从数据到推理的完整实践与性能对比

LoRA微调7B大模型:从数据到推理的完整实践与性能对比

本文记录了我在单张24GB显存GPU上使用LoRA/QLoRA微调Qwen2.5-7B-Instruct的全过程。训练数据为12k条中文指令数据,采用4-bit量化+LoRA(r=16, alpha=32),仅训练约0.8%参数。3个epoch后loss从2.31降至0.76,显存峰值18.3GB。推理对比显示,微调后在目标领域任务上的准确率从基座的52%提升至87%,同时保持了通用对话能力,推理

大模型案例库 6 1 0 14小时前
FastAPI+Flask接口响应从1.8s降到120ms:一次API性能调优的profiling与缓存实践

FastAPI+Flask接口响应从1.8s降到120ms:一次API性能调优的profiling与缓存实践

某内部商品查询接口在FastAPI 0.110 + Flask 3.0 双栈环境下,P95响应时间高达1.8s,QPS仅42。通过cProfile+py-spy定位到N+1查询与重复序列化问题,配合SQLAlchemy 2.0的selectinload、Redis 7.2缓存与orjson替换,最终P95降至120ms,QPS提升到680,数据库QPS下降约83%。本文记录完整定位过程、核心代码与

长期关注解决方案工作台 7 1 0 15小时前
FastAPI+Flask接口从1.2s压到80ms:一次真实的性能瓶颈定位与优化

FastAPI+Flask接口从1.2s压到80ms:一次真实的性能瓶颈定位与优化

线上一个FastAPI商品详情接口P99飙到1.2s,QPS只有60就报警。用py-spy火焰图定位到同步阻塞的ORM N+1查询,配合SQLAlchemy的selectinload、Redis缓存和Flask侧的连接池调优,最终P99降到80ms,QPS从60提升到1100+。本文完整记录了profiling、数据库优化、缓存策略和压测数据对比的全过程。

刺猬不想加班日记 4 0 0 16小时前
用asyncio重构订单查询API:QPS从120提升到2300的完整记录

用asyncio重构订单查询API:QPS从120提升到2300的完整记录

一个日均调用量800万的订单查询API,在Python 3.11 + FastAPI环境下,因同步阻塞IO导致P99延迟高达1.8秒、QPS卡在120。本文完整记录用asyncio + asyncpg + httpx重写数据访问层的过程,包含before/after可运行代码、连接池参数调优、以及压测得到的真实数据对比:QPS提升19倍,P99从1830ms降到76ms。

企业级多模态探索频道 11 2 0 18小时前
我用GPT-4o做合同信息抽取:5版Prompt对比,Token差3倍准确率差41%

我用GPT-4o做合同信息抽取:5版Prompt对比,Token差3倍准确率差41%

同一个合同字段抽取任务,我写了5版Prompt,从朴素提问到Few-shot+结构化约束,Token消耗从312涨到1047,但准确率从54%提升到95%。本文完整记录了每版Prompt的设计思路、实测数据(含GPT-4o-2024-08-06与Claude 3.5 Sonnet对比)、踩过的JSON截断和幻觉字段坑,并给出最终生产可用的Prompt模板与成本核算。

长期关注运营思考录 11 3 0 20小时前
FastAPI+Flask接口从1200ms降到180ms:一次API性能瓶颈的profiling与优化记录

FastAPI+Flask接口从1200ms降到180ms:一次API性能瓶颈的profiling与优化记录

一个日请求量约200万的订单查询接口,P95响应时间从1200ms优化到180ms,QPS从45提升到320。本文记录了完整的排查过程:用py-spy和cProfile定位到N+1查询和同步阻塞,通过selectinload、Redis缓存和连接池调优解决,附压测数据对比和可运行的代码示例。

老陈Python手记 14 1 0 21小时前
用asyncio重构Flask风控接口,QPS从120提升到1100

用asyncio重构Flask风控接口,QPS从120提升到1100

某风控查询接口单次请求需串行调用3个下游HTTP服务,Flask同步模型下压测QPS只有120,P99高达1.8s。本文用asyncio+aiohttp把下游调用改为并发,配合连接池与超时控制,在4C8G机器上把QPS推到1100,P99降到210ms,CPU占用反而下降35%。文中给出完整before/after代码、压测脚本和踩坑记录。

04201. 职场学习簿 8 1 0 23小时前
LangChain与AutoGPT之外:从零手写一个可用的AI Agent核心循环

LangChain与AutoGPT之外:从零手写一个可用的AI Agent核心循环

调用LangChain的`AgentExecutor`三行代码就能跑通Demo,但工具调用失败时为什么整个链路直接崩掉?记忆窗口设置成多少才不炸Token?本文不依赖任何Agent框架,用约300行Python从零实现一个AI Agent,覆盖工具注册与JSON Schema校验、基于滑动窗口+摘要的混合记忆、指数退避重试与降级策略、以及带最大步数和死循环检测的ReAct循环控制。实测在GPT-4

持续研究战略工具箱 10 1 0 1天前
React Context 与 Pinia 状态管理迁移:方案对比、步骤与性能数据

React Context 与 Pinia 状态管理迁移:方案对比、步骤与性能数据

一个中后台项目在 React 18.2 与 Vue 3.3 双栈并行期,把 37 个全局状态从 Props/Context 迁到 Zustand 4.4 与 Pinia 2.1。迁移后首屏渲染从 1.8s 降到 1.1s,组件重渲染次数下降约 62%,包体积仅增加 3.2KB(gzip)。本文记录方案对比、迁移步骤、真实性能数据,以及踩过的 5 个坑。

向内求解设计学习者 10 1 0 1天前
用asyncio重构Web API:QPS从120提升到2100的优化记录

用asyncio重构Web API:QPS从120提升到2100的优化记录

一个查询3个外部HTTP接口的Python Web API,使用Flask+requests同步实现时QPS只有120,P99延迟高达1.2s。改用FastAPI+asyncio+httpx异步方案后,QPS提升到2100,P99降到85ms。本文包含完整的before/after代码、压测数据对比,以及asyncio.gather、连接池、超时控制等踩坑细节。

一线全栈日志 15 3 0 1天前
用asyncio重构Flask接口:QPS从120提升到1100的异步优化记录

用asyncio重构Flask接口:QPS从120提升到1100的异步优化记录

一个内部推荐服务接口,原先用Flask同步调用3个下游HTTP接口,P99延迟480ms、QPS只有120。改造成asyncio+aiohttp异步编排后,单机QPS跑到1100,P99降到95ms,机器数从8台减到2台。本文完整记录before/after代码、并发参数调优、以及踩过的连接池和事件循环坑,附实测压测数据。

前端学习簿 8 1 0 1天前
1 2 3 ... ... 28 29 30 下一页

作者推荐