智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
全部 AI AI开发实战 FastAPI/Flask LangChain/AutoGPT LoRA/QLoRA Milvus/Qdrant React/Vue asyncio 学习笔记 容器化部署 开发实战 开源推荐 技术博客 技术选型 提示词工程 检索增强生成 版本控制 踩坑记录
Python异步编程:asyncio优化Web API响应时间提升5倍

Python异步编程:asyncio优化Web API响应时间提升5倍

在压测一个基于Django+requests的订单查询API时,我发现接口在20并发下P95响应时间高达1.8秒,而数据库查询本身只需120ms。通过引入asyncio+httpx重写业务调用链,将三次串行外部HTTP请求改为异步并发,P95响应时间从1.8s降至350ms,吞吐量提升4.7倍。本文记录了完整的优化过程——从问题定位、asyncio改造方案、代码迁移细节到生产环境踩到的坑(如事件循

向内求解机器学习修炼册 80 16 0 12天前
asyncio重构Flask接口,QPS从187到1520的并发改造实录

asyncio重构Flask接口,QPS从187到1520的并发改造实录

在一次电商订单导出服务中,我遇到CPU空闲但接口超时的诡异场景。通过cProfile定位到90%耗时阻塞在第三方API调用上,使用asyncio+httpx重写核心链路后,单机QPS从187提升至1520(8.1倍),P99延迟从2.3s降至340ms。本文将完整记录这次改造过程,包括asyncio.Semaphore限流的正确姿势、与Flask同步生态的集成方案,以及协程池+线程池混合调度的性能

猞猁喜欢开源日记 153 32 0 12天前
asyncio重构Flask接口,QPS从120飙到850

asyncio重构Flask接口,QPS从120飙到850

一个内部报表接口因串行调用三次外部HTTP服务,单机QPS只有120,P99延迟2.3秒。我用asyncio配合httpx重写核心逻辑,连接池复用+并发请求,QPS提升至850,P99降至380ms。文章记录了完整的重构过程:从协程设计、信号量限流到UVloop切换,包含before/after代码和压测数据,以及一个让人抓狂的event loop坑。

长期主义智能体学习者 124 30 0 12天前
LoRA微调7B模型全记录:从显存优化到指令遵循能力跃升

LoRA微调7B模型全记录:从显存优化到指令遵循能力跃升

本文记录使用LoRA(Low-Rank Adaptation)微调Qwen2-7B-Instruct模型的具体实践过程。在单张A100-80G显卡上,通过QLoRA(4bit量化+LoRA)将显存占用从70GB压缩至18GB,微调成本降低60%。基于alpaca-cleaned中文指令数据集训练3个epoch后,模型在CEval验证集上的得分从47.2提升至58.6(+24.1%),在人工构造的5

多模态观察员 85 20 0 12天前
React/Vue项目从Context到Zustand/Pinia重构:性能提升与迁移实践

React/Vue项目从Context到Zustand/Pinia重构:性能提升与迁移实践

在维护一个中型后台管理系统时,我遇到了状态管理混乱的问题:Context频繁重渲染导致页面卡顿,Props层层传递让代码维护成本飙升。本文记录了将React 18项目从Context+Props迁移到Zustand 4.x,以及Vue 3项目从Provide/Inject迁移到Pinia 2.x的完整实践。通过对比三种方案的性能数据,展示了迁移后组件渲染次数减少约60%,页面交互响应时间从120m

认真成长设计修炼册 89 16 0 12天前
用asyncio重构Flask API,QPS从180到1500的完整记录

用asyncio重构Flask API,QPS从180到1500的完整记录

一个普通的Flask同步接口,压测QPS只有180,响应时间P99高达2.3秒。通过asyncio + aiohttp重写为协程并发模型,QPS提升到1500,P99降到280ms。本文记录这次重构的完整过程:从问题定位、方案选型(asyncio vs 多线程)、核心代码实现(含before/after对比)、到生产环境踩坑(Event Loop阻塞、连接池耗尽、超时控制)。附Python 3.1

企业级Agent开发日志 114 23 0 12天前
7B模型LoRA/QLoRA微调实录:显存从24G降到6G的推理质量对比

7B模型LoRA/QLoRA微调实录:显存从24G降到6G的推理质量对比

微调一个7B模型(这里以Qwen2-7B-Instruct为例)从全参到LoRA再到QLoRA,显存占用从24G+一路压到6.2G,但推理效果在特定任务上却出现了分化。本文记录了完整的微调流程:数据预处理(1.2万条指令数据)、训练配置(LoRA rank=64, alpha=128)、loss曲线分析,以及微调前后在代码生成和数学推理上的效果对比。结论:QLoRA在4-bit量化下训练,推理质量

知识库案例库 78 21 0 12天前
RAG召回率从61%到89%:chunk重构、Embedding换代与Rerank落地的全记录

RAG召回率从61%到89%:chunk重构、Embedding换代与Rerank落地的全记录

一个月前,我们内部的智能客服知识库RAG系统在500条真实测试集上,Hit@5召回率只有61%,答非所问是常态。经过对chunk策略的两次重构(256字固定切分改为语义段落树)、将Embedding从`text2vec-large-chinese`替换为`BAAI/bge-large-zh-v1.5`,并在检索链路末尾引入`bge-reranker-v2-m3`重排,最终将Hit@5提升至89%,

长期关注用户研究思考录 89 16 0 14天前
Prompt模板迭代实录:从3.2%到41.7%的RAG问答准确率提升

Prompt模板迭代实录:从3.2%到41.7%的RAG问答准确率提升

同一套知识库问答系统,仅靠改写Prompt指令,GPT-4o-mini的答案准确率从3.2%飙升到41.7%,关键字段提取完整率提升5倍。本文记录了针对“企业设备故障工单问答”任务的5轮Prompt迭代过程,包含每轮Prompt原文、温度参数、token消耗实测数据(含输入/输出缓存命中率)以及错误类型分析。最终方案在保持单次推理成本≤0.003美元的前提下,将“步骤完整性”评分从1.8/10提升

持续研究复盘实践笔记 78 17 0 14天前
React/Vue项目从Context到Zustand/Pinia:状态管理迁移实践与性能对比

React/Vue项目从Context到Zustand/Pinia:状态管理迁移实践与性能对比

随着项目迭代,React 18 + Context 与 Vue 3 + Provide/Inject 在处理高频更新(如实时表单、WebSocket推送)时出现严重性能瓶颈:组件树从根部开始重渲染,页面卡顿,DevTools 中观察到每秒 60+ 次冗余渲染。本文记录了将一个 2 万行代码的中后台系统从 Context/Props 迁移到 Zustand 4.5(React)与 Pinia 2.1

文档又出问题观察员 125 23 0 14天前
asyncio重构Flask接口:请求耗时从2.3秒降至0.8秒全记录

asyncio重构Flask接口:请求耗时从2.3秒降至0.8秒全记录

公司内部一个数据聚合API,需要并行调用3个上游服务(用户画像、订单统计、风控标签),最初使用requests同步调用,P99延迟高达2.3秒,数据库连接池经常被打满。我用asyncio + aiohttp + uvloop重写后,P99降到0.8秒,单机QPS从150提升到420,数据库连接数下降70%。本文记录完整重构过程,包括事件循环选择、信号量限流、超时控制、以及多个实战踩坑点,代码可直接

海边赶路集 127 26 0 15天前
RAG命中率从67%到89%:chunk重构与rerank双阶段调优实录

RAG命中率从67%到89%:chunk重构与rerank双阶段调优实录

在搭建企业知识库问答系统时,我们遇到检索结果漂移、答案截断等典型RAG痛点。通过将固定512字符切块改为递归字符+标题感知切块,并引入bge-large-rerank重排序模型,配合从text2vec-large-chinese到bge-m3的Embedding升级,最终让Top-5命中率从67.3%提升至89.1%,单次检索耗时从420ms降至310ms。本文记录了完整的调参过程、代码实现与踩坑

生产级Agent构建者 103 23 0 15天前
FastAPI与Flask压测对比:PySpy定位慢查询与Redis缓存层优化实录

FastAPI与Flask压测对比:PySpy定位慢查询与Redis缓存层优化实录

某电商订单查询接口在QPS 200时P95延迟飙至2.8s,Flask+ORM原生查询是罪魁祸首。本文用PySpy火焰图定位N+1查询与序列化瓶颈,通过SQLAlchemy 2.0的`selectinload`预加载、Redis 7.0缓存热点数据、Gunicorn+Uvicorn混合部署,将P95从2.8s降至310ms,QPS提升至1200。全程附压测数据(wrk/locust)与可运行代码,

实战派Prompt观察员 119 24 0 16天前
LangChain与AutoGPT融合:手写Agent循环控制与记忆管理

LangChain与AutoGPT融合:手写Agent循环控制与记忆管理

一个真实可运行的AI Agent,不在于调用多牛的模型,而在于工具定义、记忆管理和循环控制这些“脏活”怎么落地。本文基于LangChain 0.1.0和AutoGPT思想,从零手写一个具备工具调用、短期记忆、错误重试和终止条件的Agent。代码实测在GPT-4-turbo下,单次任务工具调用成功率从67%提升到94%,并给出完整可复现代码与踩坑记录。

云端狐狸每天复盘 91 23 0 16天前
React 19与Vue 3.5下从Context到Zustand/Pinia的迁移实录:性能提升与踩坑复盘

React 19与Vue 3.5下从Context到Zustand/Pinia的迁移实录:性能提升与踩坑复盘

在最近重构一个中型后台管理系统时,我面临了组件层级过深导致的Context频繁重渲染问题——**打开一个包含500行表格的页面时,React DevTools显示单次交互触发27次Provider更新,页面卡顿1.2秒**。本文记录了从原生Context/Props迁移到Zustand(React)与Pinia(Vue)的完整过程,包括方案选型对比、分步迁移策略、以及迁移后首屏渲染时间降低63%、

小周_Go 105 27 0 16天前
FastAPI与Flask性能对决:Profiling定位慢查询与缓存优化全记录

FastAPI与Flask性能对决:Profiling定位慢查询与缓存优化全记录

在最近一次电商订单接口压测中,我负责的FastAPI服务QPS从380跌至220,P95延迟飙升至2.1秒。通过py-spy和slowquery日志定位,发现瓶颈竟藏在看似无害的ORM关联查询中。本文记录了我用cProfile+py-spy对FastAPI(0.95)与Flask(2.3)双服务进行剖析、将N+1查询改写为JOIN、并引入Redis缓存后的完整过程。压测数据从优化前QPS 220提

分支拒绝内耗观察员 140 36 0 16天前
Milvus 2.4与Qdrant 1.9对决:电商语义检索场景实测与选型决策

Milvus 2.4与Qdrant 1.9对决:电商语义检索场景实测与选型决策

在商品标题向量检索场景下,本文实测Milvus 2.4.1与Qdrant 1.9.2的部署成本、查询性能与资源占用。测试集为100万条768维向量,单机16C32G配置。结果显示:Qdrant在纯向量过滤查询(过滤率30%)时P99延迟低至12ms,比Milvus快38%;但Milvus在批量写入场景吞吐量达8.2k QPS,是Qdrant的2.3倍。内存占用方面,Qdrant峰值仅6.8GB,M

实战派NLP工程手记 107 27 0 16天前
FastAPI 压测 3 倍性能提升:Profiling 定位与缓存落地实录

FastAPI 压测 3 倍性能提升:Profiling 定位与缓存落地实录

上周接手一个基于 FastAPI 的报表服务,线上 P99 延迟从 320ms 飙升至 1.2s,数据库连接池被打满。本文记录完整的调优过程:先用 py-spy 和 cProfile 定位到两个核心瓶颈——N+1 查询与重复计算;再通过 SQLAlchemy 2.0 的 `selectinload` 优化关联加载,结合 Redis 缓存热点数据;最后用 Locust 压测对比,QPS 从 420

深度学习落地指南 126 29 0 16天前
asyncio重构Flask API:并发等待从2.1秒降至0.4秒

asyncio重构Flask API:并发等待从2.1秒降至0.4秒

上周排查生产环境某报表接口,发现单次请求需顺序调用3个下游HTTP服务,平均耗时2.1秒,高峰期线程池直接打满。用asyncio+aiohttp重构后,同样的逻辑耗时降为0.4秒,QPS提升5倍,CPU占用反而下降30%。本文记录完整的重构过程,包含asyncio.Semaphore限流、asyncio.wait_for超时控制、以及与Flask协同的坑(event loop冲突、协程泄漏)。所有

解决方案增长记 127 23 0 16天前
LangChain 0.3手写Agent:记忆池与循环控制全拆解

LangChain 0.3手写Agent:记忆池与循环控制全拆解

上周用AutoGPT跑了一个竞品分析任务,结果它在一个循环里空转了37分钟,消耗了2.1万token才跳出。这个痛感让我决定手写一个轻量Agent。本文基于LangChain 0.3.7,从零实现了一个支持工具注册、滑动窗口记忆、异常熔断和最大迭代控制的Agent核心。实测在百度百科+天气工具的组合下,5轮对话的token消耗比AutoGPT默认配置降低了62%,任务完成时间从平均48秒压缩到11

小北Rust手记 171 33 0 17天前
上一页 1 2 3 ... 6 7 8 ... 31 32 33 下一页

作者推荐