- 博客(2143)
- 资源 (385)
- 问答 (103)
- 收藏
- 关注
原创 基于测试集优化大模型提示词,进阶优化小模型
这样大模型跑提示词可在测试集达到95%以上的正确率,但用这个提示词标注训练集,训练的小模型正确率为86%,虽比 未优化的提示词标注的训练集训练的小模型在测试集正确率由75%提升到86%,但还有提升空间。这里,提示词标注的训练集 可能是一个200W的集合,或者500W的集合,或者1000W的集合。
2026-09-11 10:31:44
17
原创 现有模型无法完全解决问题时,TAIR解决高频流量的问题
这时候,可以用TAIR缓存(新的业务场景标准定义下的)大模型离线推理的匹配结果,解决高频流量,然后现有模型cover长尾流量。但在新的需要衡量query和poi-name匹配度的业务场景,因为标准定义原因,现有的模型,无法完全解决新的业务场景的问题,现在有个文本匹配模型,可以衡量query和poi-name的匹配度,如果再训一个新匹配模型,来替换现有匹配模型,投入产出比太低了。
2026-09-02 13:43:08
205
原创 大模型提效工作
把自己看成一个中枢调度中心,指挥各个Agent/LLM干活,别觉得走通Agent流程费事,磨刀不误砍柴工。想办法把东西都让Agent接触到,
2026-08-27 14:53:29
31
原创 人工标注测试集的AI辅助
可用多种大模型或多套(完成相同任务的)提示词,分别对测试集进行推理,找出里面label不一致的数据,再进行人工标注,考虑需基于测试集优化LLM提示词,完成一个具体NLP任务,这时候测试集本身需要人工标注,可节省人工标注全部测试集的时间。
2026-08-27 12:42:41
26
原创 做线上模型的TAIR缓存技巧
然后把预测结果直接灌入TAIR做成缓存啊,不用离线用模型推理刷之后再灌入TAIR啊。可以用线上日志记录这个模型的预测结果,部署了一个线上模型,
2026-08-21 16:50:15
34
原创 图片embedding微调记录
如果有每个图所在的POI(店铺/景点)text信息,对比学习可以把这些POI信息融入,用POI给图片更多区分度:(实现了跨卡对比学习)提升负例难度,可以准备相似的其他POI作为负例,比如把 POI类目 相同的POI聚到一个batch里。又尝试了卡相似度阈值卡正负例:就是用Base模型的emb,在训练时算相似度,给正负例卡阈值分数;用站内的美食+风景图片微调Qwen3-VL-2B-Embedding模型,又尝试了用Qwen3.5多模态模型写提示词选出高质量的站内图训练。DINO是纯拉开单图的距离,训了。
2026-08-21 10:51:37
252
原创 vLLM模型启动参数 速度优化
● longest_edge: 1000000 和 shortest_edge: 10000:设置了一个非常宽松的图片尺寸范围,意味着接受大范围的图片分辨率而不强制缩放。● 配合 Vision Encoder 的 dynamic resolution 机制,让模型自适应处理不同尺寸的图片。● 保留图片原始分辨率的更多信息,减少因过度缩放导致的视觉 token 数量变化,使 Prefill 计算更可预测。● 避免了预处理器对图片做不必要的 resize/padding 操作,减少预处理阶段的 CPU 耗时。
2026-07-16 11:07:18
55
原创 请求vLLM禁用thinking模式
“enable_thinking”: False“chat_template_kwargs”: {“enable_thinking”: False}{“type”: “text”, “text”: “/no_think”}
2026-07-16 10:27:57
105
原创 搜索相关性模型的待标注数据准备
不建议:用query cross-join doc出的pair数据,也许可以用一些比如Qwen3-Emb模型多筛选出正例,但总体数据效率还是低,建议:模拟召回链路,对top的query进行top候选doc的召回,构成pair数据。线上曝光日志的query-doc pair是肯定可以加进来的,
2026-06-30 22:52:36
30
原创 针对测试集的提示词自动化优化
跑提示词 --> 出测试集badcase --> 调用Cursor SDK根据badcase改提示词 -->再跑提示词 --> 再出badcase --> 再让Cursor改提示词 --> 循环。目标是写提示词让大模型做具体NLP或多模态任务,
2026-06-19 17:38:27
102
原创 SQL多个表JOIN的速度优化
JOIN的右侧表,如果有多次SELECT相同的TABLE造成的多次JOIN,能合并成一次SELECT解决,就合并成一次SELECT这个TABLE进行JOIN。一个SQL里JOIN多个表,如果跑的很慢,可以尝试分步JOIN,一步的JOIN写入中间临时表,再和其他的表JOIN。各个表的大小都差不多,不能用MAPJOIN优化时。
2026-05-31 21:36:23
203
原创 读图片url训练/推理,速度慢,如何优化
从OSS/NAS读已经下载的图片训练/推理,也不快,还不如直接读image_url。放弃落盘OSS/NAS,读image_url就训练/推理,速度也起不来,但没深究。
2026-05-15 13:50:22
88
原创 CommandNotFoundError: Your shell has not been properly configured to use ‘conda activate‘.
【代码】CommandNotFoundError: Your shell has not been properly configured to use ‘conda activate‘.
2026-05-13 15:47:11
158
原创 在训练数据里修复embedding相似度计算的badcase
2,用input_text3和input_text4检索出训练数据中最相似的那批数据。,计算相似度不正确,我该如何在训练数据里修复这一个badcase,再重训模型?1,有针对性的训练样本,加入到你的训练数据中。计算相似度的方式训练embedding,
2026-04-27 09:41:50
73
原创 ODPS每个worker里面有个UDF,UDF里有http请求,报错timeout
有监控的话,看下http请求的服务端的QPS多少,大概率是QPS太低了,
2026-04-27 09:09:43
105
原创 搜索相关性模型,选用分类Loss输出档位,还是回归Loss输出0~1分数
Target Label自然从[0, 1, 2, 3]映射到[0.0, 0.33, 0.66, 1.0]分,直接体现出类别之间的有序性,不容易出排序上的badcase,因为如果一个数据如果是0.5分,错误顶多可能给预测到0.7分,还行,但是选分类Loss的话,如果0档给预测成3档,会比较严重。
2026-03-27 22:15:38
208
原创 基于向量相似度的搜索结果去重算法
离线通过cosine相似度计算,用每个keyword去检索其余9999个keyword,取topN keyword,然后用LLM加去重判断,现在比如有10000个keyword,都有keyword-embedding,去重后的结果做成key-value格式的,导入到线上比如tair数据库,线上用户输入的input作为key去读tair数据库。
2026-03-19 14:54:42
92
原创 LLM做文本分类的提示词工程
的推理过程,发现,如果每个类目给了20-30个showcase列表,其实LLM最多只会利用其中1-5个showcase,其余showcase会忽略掉,想指望LLM能从给的20-30个showcase中,像人类标注员一样自己提炼出泛化规则,LLM是不能的,这也是说,如果想写大量的showcase来实现自己所设想的LLM标注时的泛化效果,以修正数据中的。badcase,是不行的,或需要再结合其他方法尝试的。所以只能从类目的定义入手优化提示词。LLM做文本分类,通过看LLM。
2026-03-14 01:28:12
108
原创 LLM做文本分类,提示词加了很多示例,评估该用think模式还是非think模式
非think模式LLM会忽略不少给的示例数据,比如我一共要分3个类ABC,在提示词里,A类写了20个示例,B类写了20个示例数据,C类写了10个示例数据,非think模式的LLM推理结果数量向A类B类倾斜,甚至最后打标到C类的数据为0条,而think模式就会全面考虑给的示例。准备了一个人工标注的测试集,评估发现用think模式正确率较高,非think模式正确率121/250,think模式正确率139/250,LLM选用Qwen3-32B,
2026-03-09 14:46:00
118
原创 在某文本分类任务上Qwen3-32B LLM打标稳定性评估
参数配置如下,主要配置 “do_sample”: false,这时temperature已经失效。参数配置如下,主要配置 “temperature”: 0.1。给100W数据打标,两次打标一致率:98.28%给100W数据打标,两次打标一致率:99.89%
2026-03-02 17:12:39
104
原创 SFT后训练32B-LLM的一些观察
之后的数据集一起SFT 32B-Base模型,或者基于32B-Chat模型SFT,用COIG-CQIA数据集,以及把COIG-CQIA数据集混合。然后在中文通用评测集CEVAL和CMMLU评测,效果都不如32B-Chat模型。
2026-01-19 10:58:05
300
原创 SQL,对每个groupby的每个group的string得到array<string>类型
【代码】SQL,对每个groupby的每个group的string得到array<string>类型。
2026-01-15 17:08:43
339
原创 SQL,对每个groupby的每个group的string进行concat
【代码】SQL,对每个groupby的每个group的string进行concat。
2026-01-13 16:03:19
177
flash-attn-2.7.4.post1+cu12torch2.4cxx11abiFALSE-cp39-cp39-linux-x86-64.whl
2025-03-23
Chinese-DeepSeek-R1-Distill-data-110k
2025-03-13
flash-attn-2.7.3+cu11torch2.4cxx11abiFALSE-cp39-cp39-linux-x86-64.whl
2025-03-15
torch-1.13.1+cu117-cp38-cp38-linux-x86-64.whl
2024-12-20
torch-2.0.0+cu118-cp38-cp38-linux-x86-64.whl的zip-1/2
2024-12-19
torch-2.0.0+cu118-cp38-cp38-linux-x86-64.whl的zip-2/2
2024-12-19
flash-attn-2.7.0.post2+cu11torch2.4cxx11abiFALSE-cp38-cp38-linux-x86-64.whl
2025-03-24
人工智能的因果学习(Causal Learning)到底想解决什么问题?
2021-12-17
强化学习是不是无人驾驶的未来?
2022-02-01
学好数学对于编程的真实增益到底是多少?
2021-11-03
总被主管说文档写的不好怎么办?
2021-11-18
GAN生成图像,弄一个discriminator ,和无D直接生成,区别是?
2022-02-01
哪些互联网公司的管理职级和专业职级是分开的?
2022-01-22
CTR模型的AUC如果比较高,是否其实只是 因为复购行为带来的AUC虚高?
2022-01-17
CTR模型的本质是不是算出 user的哪些特征和item的哪些特征 最匹配?
2022-01-08
BYOL里stop-gradient的作用是什么?
2021-12-01
马上2022年了,pointer-network现在看来的作用是什么?
2021-11-26
马上2022年了,强化学习+NLP 有了哪些突破?
2021-11-26
每个物理公式是否都是在【描述】一个事情?
2021-10-12
NER任务只有一个类的情况下,BME或者Yes-No的数据预处理方式对结果有影响吗?
2021-11-08
学好数学对于编程的真实增益的性价比到底如何?
2021-11-03
如果说每一个数学公式都在描述一件事情,那么数学公式的推导,是在做什么?
2021-10-26
求通俗讲讲数学或理论物理进行研究的细节,复杂公式是不是也都是由基础公式而来?
2021-09-14
自动驾驶,如何得到方向盘转动的ground truth?
2024-03-18
AlphaGo能超越人类,因为训练时 对于模型的每个输入,都有一个100%正确的答案?
2024-01-16
其实LLM/ChatGPT是否在距离AlphaGo式AI越来越远?
2024-01-16
技术上,ChatGPT要成为 AI医生/AI律师/AI教师 还欠缺哪些能力?
2024-01-11
数学 是且仅是 一种语言和一种工具,不是科学的全部?
2023-12-14
哪些时候用CUDA编程更好?
2023-12-14
用RL做NLP,和 根据那条数据的reward重新标注那条数据 有什么区别?
2022-05-07
2022年了,USB式GPU有哪些进展?
2022-04-28
没有物理机器人载体,如何在模拟环境里的进行学习和研究机器人?
2022-04-28
2022年了,有哪些稳压deepfm的CTR模型?
2022-04-01
CTR模型,如果上线了没效果,这时可以进行哪些分析工作?以及有无必要投入大量时间分析?
2022-03-24
算法工程师如何应对做算法策略的不确定性;比如没效果,这时绩效怎么保证?
2022-03-01
CTR模型必须要有一个测试数据集吗? 训练数据集和测试数据集是同一个,可以吗?
2022-02-25
因果推断技术靠谱吗,感觉里面的影响因素太多了,所以能实际解决落地问题吗?
2022-02-08
为啥我感觉现在机器学习模型就是一种模糊匹配工具or相似识别工具?
2022-02-16
XGB/GBDT/决策树,得出特征重要性的原理是什么?
2022-02-08
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅