<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[jollyjumper的专栏]]></title><description><![CDATA[一点记录]]></description><link>https://blog.csdn.net/jollyjumper</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; jollyjumper]]></copyright><item><title><![CDATA[火山引擎DataTester：A/B测试，让企业摆脱广告投放“乱烧钱“笔记]]></title><link>https://blog.csdn.net/jollyjumper/article/details/129102169</link><guid>https://blog.csdn.net/jollyjumper/article/details/129102169</guid><author>jollyjumper</author><pubDate>Sat, 18 Feb 2023 22:25:39 +0800</pubDate><description><![CDATA[“MAB实验”是智能调优实验，实验方案可以直接在线上进行，DataTester将根据实时数据反馈，智能调节实验方案的流量分配，给广告收益效果好的方案倾斜更多的流量，帮助企业收益最大化。]]></description><category></category></item><item><title><![CDATA[Learning To Rank简述]]></title><link>https://blog.csdn.net/jollyjumper/article/details/115923264</link><guid>https://blog.csdn.net/jollyjumper/article/details/115923264</guid><author>jollyjumper</author><pubDate>Wed, 21 Apr 2021 01:02:00 +0800</pubDate><description><![CDATA[https://zhuanlan.zhihu.com/p/68682607

经典的Learning To Rank: RankNet-&gt;LambdaRank-&gt;LambdaMART

RankNet: pairwise,损失函数为交叉熵，学习方法为逻辑回归

LambdaRank: 直接简单粗暴地在RankNet加速算法形式的梯度上乘上Lambda梯度z,z为评价指标，可取NDCG、ERR等。

LambdaRank相比RankNet的优势：分解因式后训练速度更快，同时考虑评价指标，效果更好
]]></description><category></category></item><item><title><![CDATA[BytePSScheduledQueue]]></title><link>https://blog.csdn.net/jollyjumper/article/details/113621437</link><guid>https://blog.csdn.net/jollyjumper/article/details/113621437</guid><author>jollyjumper</author><pubDate>Wed, 03 Feb 2021 22:55:14 +0800</pubDate><description><![CDATA[这个类主要是对TensorTableEntry的任务进行管理，应该都用于设备之间数据通信：



以下为TensorTableEntry定义:


]]></description><category></category></item><item><title><![CDATA[shared_memory]]></title><link>https://blog.csdn.net/jollyjumper/article/details/113617226</link><guid>https://blog.csdn.net/jollyjumper/article/details/113617226</guid><author>jollyjumper</author><pubDate>Wed, 03 Feb 2021 22:09:58 +0800</pubDate><description><![CDATA[共享内存管理接口，用一个map保存所有的共享内存，为了加速和GPU通信，使用了cudaHostRegister/cudaHostUnregister接口：



比较特殊的是openPcieSharedMemory，会返回一个地址列表，会在多个PCIE Switch各分配一个共享内存(PCIE-Switch是为了解决CPU PCIE接口数量不足的问题(每个CPU 40个PCIE接口)
...]]></description><category></category></item><item><title><![CDATA[BytePSCommunitor]]></title><link>https://blog.csdn.net/jollyjumper/article/details/113612571</link><guid>https://blog.csdn.net/jollyjumper/article/details/113612571</guid><author>jollyjumper</author><pubDate>Wed, 03 Feb 2021 16:55:46 +0800</pubDate><description><![CDATA[对应的文件为common/communitor.h,common/communitor.cc

这个是单机上多个GPU之间通信使用的，会创建unix域的数据报套接字。

发送的数据格式为：



净载荷只有一个key，BytePSCommunitor提供了发送、广播、接收的功能，root设备还有一个监听线程，会调ByptePSGlobal的相关成员变量的回调函数：

涉及的数据结构为ReadyTable:



可以看出，是预设一个_ready_count，接收相应信号之后，对应key加1，最后判断两个计数]]></description><category></category></item><item><title><![CDATA[(转)SignSGD 及其 MXNet 实现解读]]></title><link>https://blog.csdn.net/jollyjumper/article/details/113572966</link><guid>https://blog.csdn.net/jollyjumper/article/details/113572966</guid><author>jollyjumper</author><pubDate>Tue, 02 Feb 2021 19:58:19 +0800</pubDate><description><![CDATA[原文：https://zhuanlan.zhihu.com/p/112346480

论文笔记：SIGNSGD: compressed optimisation for non-convex problems

这是一篇来自 Caltech，Amazon AI 和 UC Irvine 的文章。

名字非常的直白，方法也异常的简单（简单并不简单）。

总结起来就是：

SGD里面，梯度真正有用的是方向而不是大小。所以，即使你只保留梯度的符号来对模型进行更新，也能得到收敛的效果。甚至有些情况下，这么做能减少梯度]]></description><category></category></item><item><title><![CDATA[（转)【深度学习】深入理解Batch Normalization批标准化]]></title><link>https://blog.csdn.net/jollyjumper/article/details/113094926</link><guid>https://blog.csdn.net/jollyjumper/article/details/113094926</guid><author>jollyjumper</author><pubDate>Sun, 24 Jan 2021 18:52:57 +0800</pubDate><description><![CDATA[原文链接：https://www.cnblogs.com/guoyaohua/p/8724433.html


这几天面试经常被问到BN层的原理，虽然回答上来了，但还是感觉答得不是很好，今天仔细研究了一下Batch Normalization的原理，以下为参考网上几篇文章总结得出。


　　Batch Normalization作为最近一年来DL的重要成果，已经广泛被证明其有效性和重要性。虽然有些细节处理还解释不清其理论原因，但是实践证明好用才是真的好，别忘了DL从Hinton对深层网络做Pre-Train]]></description><category></category></item><item><title><![CDATA[GPU架构]]></title><link>https://blog.csdn.net/jollyjumper/article/details/108706332</link><guid>https://blog.csdn.net/jollyjumper/article/details/108706332</guid><author>jollyjumper</author><pubDate>Mon, 21 Sep 2020 11:54:00 +0800</pubDate><description><![CDATA[费米架构: 2010年发布
开普勒架构: 2012年发布
麦克斯韦尔架构: 2014年发布 Tesla M40
帕斯卡架构: 2016年发布 Tesla P4 P100
伏特架构: 2017年 Tesla V100
图灵架构: 2018年 Tesla T4
安培架构: 2020年
]]></description><category></category></item><item><title><![CDATA[(转)一文看懂HNSW算法理论的来龙去脉]]></title><link>https://blog.csdn.net/jollyjumper/article/details/108433977</link><guid>https://blog.csdn.net/jollyjumper/article/details/108433977</guid><author>jollyjumper</author><pubDate>Sun, 06 Sep 2020 17:24:10 +0800</pubDate><description><![CDATA[原文链接:https://blog.csdn.net/u011233351/article/details/85116719

一.背景介绍

    在浩渺的数据长河中做高效率相似性查找一直以来都是让人头疼的问题。比如，我在搜狗app上阅读了一篇文章，推荐系统就应当为我推送与这篇文章最相近的文章，数据库中所有文章是用向量表示的，所以我们要解决的问题就是“找到与这篇文章的向量最相近的几个向量”，然后把这些向量对应的文章推送出去。数据库中的文章千千万，所有用户每秒的请求也是千千万，我们需要又快又准又...]]></description><category></category></item><item><title><![CDATA[技术人员如何做好职级晋升答辩]]></title><link>https://blog.csdn.net/jollyjumper/article/details/106722304</link><guid>https://blog.csdn.net/jollyjumper/article/details/106722304</guid><author>jollyjumper</author><pubDate>Fri, 12 Jun 2020 19:23:01 +0800</pubDate><description><![CDATA[原文：http://itindex.net/detail/59406-%E6%8A%80%E6%9C%AF%E4%BA%BA%E5%91%98

标签：技术人员| 发表时间：2019-03-27 23:13 | 作者：明城

出处：https://www.gracecode.com/

三月即将过去四月份即将到来，很多公司年后的职级晋升安排即将结束。

同时，晋升的结果也将陆陆续续公布出来。几家欢喜几家愁，晋升成功的同事自然值得祝贺，没有过的同事也不要气馁再接再励。

对于技术人员而言，普遍有个很共通的..]]></description><category></category></item><item><title><![CDATA[Focused crawling: a new approach to topic specific web resource discovery]]></title><link>https://blog.csdn.net/jollyjumper/article/details/104547650</link><guid>https://blog.csdn.net/jollyjumper/article/details/104547650</guid><author>jollyjumper</author><pubDate>Thu, 27 Feb 2020 23:49:45 +0800</pubDate><description><![CDATA[论文地址:https://courses.cs.washington.edu/courses/cse454/05sp/papers/chakrabarti99focused.pdf

这是一篇非常详细的论文,成于1999年,关于主题爬虫引用数最高(高达2294次)的论文.

其具体做法是: 对种子url进行分类,其分类体系是树状的,并确保所有种子url都被分在叶子类目上,并训练出分类模型(论文中...]]></description><category></category></item><item><title><![CDATA[Mac小技巧: 使用home brew services]]></title><link>https://blog.csdn.net/jollyjumper/article/details/104533873</link><guid>https://blog.csdn.net/jollyjumper/article/details/104533873</guid><author>jollyjumper</author><pubDate>Thu, 27 Feb 2020 14:17:36 +0800</pubDate><description><![CDATA[参考:https://thoughtbot.com/blog/starting-and-stopping-background-services-with-homebrew

比如,在安装squid(brew install squid)之后要启动服务:

brew tap homebrew/services

brew services start squid
...]]></description><category></category></item><item><title><![CDATA[常见docker命令备查]]></title><link>https://blog.csdn.net/jollyjumper/article/details/104527176</link><guid>https://blog.csdn.net/jollyjumper/article/details/104527176</guid><author>jollyjumper</author><pubDate>Wed, 26 Feb 2020 22:57:54 +0800</pubDate><description><![CDATA[主要来自第一本docker书(修订版):

docker run -i -t ubuntu /bin/bash

docker ps (-l)

docker run --name bob_the_container -i -t ubuntu /bin/bash

docker start bob_the_container

[docker create]

docker attach

doc...]]></description><category></category></item><item><title><![CDATA[selemium环境准备]]></title><link>https://blog.csdn.net/jollyjumper/article/details/104523042</link><guid>https://blog.csdn.net/jollyjumper/article/details/104523042</guid><author>jollyjumper</author><pubDate>Wed, 26 Feb 2020 19:26:17 +0800</pubDate><description><![CDATA[查找对应版本的chrome driver: http://chromedriver.chromium.org/downloads
解决DevToolsActivePort file doesn't exist: https://cloud.tencent.com/developer/article/1404558

测试代码:
  public static void main(String[...]]></description><category></category></item><item><title><![CDATA[TextRank: Bringing Order into Texts论文笔记]]></title><link>https://blog.csdn.net/jollyjumper/article/details/104305419</link><guid>https://blog.csdn.net/jollyjumper/article/details/104305419</guid><author>jollyjumper</author><pubDate>Fri, 14 Feb 2020 00:51:29 +0800</pubDate><description><![CDATA[原来在搜PageRank论文时找到这篇04年发表、引用次数3066次的论文。

原文链接:https://www.aclweb.org/anthology/W04-3252.pdf

阅读之后，发现并不是做网页排序或者爬虫调度相关的。而是利用PageRank/Hits等随机游走的方法对文本中的单元计算出类似PageRank的值，用来做无监督的关键词抽取、关键句子抽取，取得了很好的效果。

具体在...]]></description><category></category></item><item><title><![CDATA[WEBSEARCH FOR A PLANET: THE GOOGLECLUSTER ARCHITECTURE]]></title><link>https://blog.csdn.net/jollyjumper/article/details/104217975</link><guid>https://blog.csdn.net/jollyjumper/article/details/104217975</guid><author>jollyjumper</author><pubDate>Sat, 08 Feb 2020 00:53:17 +0800</pubDate><description><![CDATA[jeff dean 03年论文，很认真地想挖掘一些点，现在看就没什么insight了，只有google早期的一些数字有点印象:几十T索引、超过15000台机器、几十行(dozens of)，使用组装PC，考虑机器单位面积功耗(包括冷却)、性价比等等，算是去ioe化的最早倡导者吧。
...]]></description><category></category></item><item><title><![CDATA[Lucene 6.6.0 BKD树]]></title><link>https://blog.csdn.net/jollyjumper/article/details/87653303</link><guid>https://blog.csdn.net/jollyjumper/article/details/87653303</guid><author>jollyjumper</author><pubDate>Mon, 18 Feb 2019 23:48:01 +0800</pubDate><description><![CDATA[相关接口使用可以看TestBKD.java。

仔细读BKDReader，BKD树是一颗完全二叉树,每个节点在一个维度上进行划分.

发现里面为了节约空间做了很多差量编码工作.其中的PackedIndexTree结构是这样的:



要知道这个结构是为了遍历树的，因此有pushLeft,pushRight,pop等操作,这里splitValuesStack可以看到冗余存了numDims维数据，但实...]]></description><category></category></item><item><title><![CDATA[矢量量化方法]]></title><link>https://blog.csdn.net/jollyjumper/article/details/85051174</link><guid>https://blog.csdn.net/jollyjumper/article/details/85051174</guid><author>jollyjumper</author><pubDate>Mon, 17 Dec 2018 16:15:30 +0800</pubDate><description><![CDATA[原文链接: https://yongyuan.name/blog/ann-search.html

矢量量化方法

矢量量化方法，即vector quantization，其具体定义为：将一个向量空间中的点用其中的一个有限子集来进行编码的过程。在矢量量化编码中，关键是码本的建立和码字搜索算法。比如常见的聚类算法，就是一种矢量量化方法。而在ANN近似最近邻搜索中，向量量化方法又以乘积量化(PQ, P...]]></description><category></category></item><item><title><![CDATA[CentOS7上faiss环境准备]]></title><link>https://blog.csdn.net/jollyjumper/article/details/85047002</link><guid>https://blog.csdn.net/jollyjumper/article/details/85047002</guid><author>jollyjumper</author><pubDate>Mon, 17 Dec 2018 11:31:18 +0800</pubDate><description><![CDATA[git clone https://github.com/facebookresearch/faiss.git

yum install openblas

yum install libopenblas

yum install openblas-openmp64.x86_64

yum install openblas*

./configure

make

yum install pyth...]]></description><category></category></item><item><title><![CDATA[faiss观感]]></title><link>https://blog.csdn.net/jollyjumper/article/details/84934022</link><guid>https://blog.csdn.net/jollyjumper/article/details/84934022</guid><author>jollyjumper</author><pubDate>Mon, 10 Dec 2018 00:01:14 +0800</pubDate><description><![CDATA[faiss不是单一支持某个算法的库,而是一组ANN算法的实现集合.

faiss支持brute force,lsh,hnsw等索引,最主要支持的还是维诺图(voronoi cells),用kmeans做了聚类训练之后生成voronoi cells,然后根据nprobes去检索对应的cell,类似于lsh,好处是索引小(lsh哈希函数越多索引越大),而且很容易预训练(kmeans聚类).

这里在建...]]></description><category></category></item></channel></rss>