分类目录：架构设计

整理了一个程序员必读书籍和文档清单
一图梳理大数据知识体系
基于Dlib、Flask和Sqlite的人脸检测和识别服务
一致哈希(Consistent Hashing)简介
PostgreSQL 9.5 架构图及外存图
微信朋友圈技术之道
[转]图解分布式一致性协议Paxos
Intel芯片架构和指令集演化
[转]MIPS、ARM、X86三大架构
OpenStack Swift源码导读之——可插拔的后端设备实现

整理了一个程序员必读书籍和文档清单

作者：童燕群 | 发布日期：三月 13, 2022 | 阅读次数（668） | 评论

所有电子书籍都是从网络收集的，参考自己的阅读习惯和技术论坛的推荐，主要是近10年来的经典书籍。重点在3个方向：计算机系统基本原理（操作系统、编译原理、算法）、计算机网络和分布式架构。还有少量的数据库介绍。

收录的书都是比较早期的经典书籍，更多聚焦在基础知识上面。对于最新的云原生、微服务和低代码等技术涉及较少。

下载链接：必读书单

阅读全文 »

(5.00分 - 1票)

Loading ... | 同时归档在：IO编程, Linux内核, 算法数据结构, 编程基础, 职业发展 | 标签：必读书单, 电子书 |

一图梳理大数据知识体系

作者：童燕群 | 发布日期：十二月 5, 2020 | 阅读次数（1,509） | 评论

转自阿里技术社区

简介： 对海量数据进行存储、计算、分析、挖掘处理需要依赖一系列的大数据技术，而大数据技术又涉及了分布式计算、高并发处理、高可用处理、集群、实时性计算等，可以说是汇集了当前 IT 领域热门流行的 IT 技术。本文对大数据技术知识体系进行划分，共分为基础技术、数据采集、数据传输、数据组织集成、数据应用、数据治理，进行相关的阐述说明，并列出目前业界主流的相关框架、系统、数据库、工具等。（文末福利：下载大数据知识体系图）

阅读全文 »

(5.00分 - 1票)

Loading ... | 同时归档在：云计算/云存储, 存储技术 | 标签：大数据, 数据处理, 数据存储, 数据应用, 数据治理, 数据计算 |

基于Dlib、Flask和Sqlite的人脸检测和识别服务

作者：童燕群 | 发布日期：十月 7, 2020 | 阅读次数（1,188） | 评论

这个十一原定的计划取消了，没有做好备份计划，也就不打算出远门了，关在家里，把一直都想做的一个本地化的人脸识别服务整了一下。提供人脸分析的开源服务似乎很多年都没有大的变化了，一直都是Dlib和OpenCV，对比了一下，Dlib更容易使用。一直没有正经写过Python代码，翻出N年前买的Python编程书，边翻书Google、边写代码。基本的代码流程比较简单，Dlib官方也有例子，很容易运行起来，但是要服务化，要做人脸比对，并且是增量的人脸比对和识别，并不容易。说做就做，最终整个服务形成如下架构。

架构图：

代码和部署使用方法在如下git工程：https://git.codefine.site:3000/Shentar/facerec

首先需要将探测的过的“人脸”存储起来，然后能输入一张人脸返回与该人脸近似的所有人脸，这样客户端好做人脸归集。很快做好了一个初步的框架：使用Flask提供REST接口接收照片，在响应中返回人脸的特征标识，使用SHA256对人脸68点位的描述向量进行HASH，返回给客户端。同时将HASH值和实际的token存储到Sqlite。第一天大概就完工了这个功能。

运行起来，发现单纯的Flask不能并发，第二个请求会报错，一次只能接受和处理一个请求。于是又按照网上的经验，使用Gunicorn和Gevent来做多线程的方案，因为习惯了单进程多线程的方式，多线程访问Sqlite需要加锁，按照通用的做法，使用一个队列来管理Sqlite实例。继续验证，发现多线程并不能加速Detect的效率，貌似Dlib不支持多线程加速。调整为多进程，四个CPU都能运用起来。

终于找到了一个能将这个3.2GHZ的四核CPU跑满的业务了 ^_^

Architecture: x86_64

CPU op-mode(s):                  32-bit, 64-bit

Byte Order:                      Little Endian

Address sizes:                   39 bits physical, 48 bits virtual

CPU(s):                          4

On-line CPU(s) list:             0-3

Thread(s) per core:              2

Core(s) per socket:              2

Socket(s):                       1

NUMA node(s):                    1

Vendor ID:                       GenuineIntel

CPU family:                      6

Model:                           94

Model name:                      Intel(R) Core(TM) i3-6100T CPU @ 3.20GHz

人脸检测的效果还不错，错误率的话，自己家用是够了。特别是在侧脸检测上面，比较准确。在人脸比对方面，错误率就要高一些了，反复验证，发现0.36的比对阀值比较合适。侧脸虽然检测率高，但是在比对上面，只用通用的拟合范数，结果会表现为差异很大。因此这里应该是需要有定制化的比对实现，只做部分比对。这块需要深入到人脸检测技术内部，去分析128D的特征值向量的每一个值，短时间内没办法去研究透了。

由于采用了多进程，因此没法共用一个Sqlite运行时实例，强行并发读写访问会导致数据库错乱，不得不又做了一个服务来封装Sqlite，多个检测进程输出的人脸特征值都发给该服务来顺序存储，同时也返回给客户端。两个服务之间同样采用REST接口交互。

准备大规模上量，将jAlbum目前使用的线上人脸识别服务切换到这个本地服务上面，又发现检测时长非常高，一张4M的图片，大概需要几秒的时间，并且还有些非常小的区块被检测到了。对于检测慢的问题，考虑降低输入的照片的像素，图片减小后，长宽的像素点都相应减少了，但是人脸的特征点并不会损失太多。因此先对图片进行降低像素和尺寸，识别完成后，对识别到的人脸在照片上的位置也要相应做缩放，对比了一下，原始大小检测和缩放后检测，再对结果做相反的缩放，最终结果误差不大，但是这样能极大提速。对于非人脸和质量不高的人脸被检测到的问题，做了一些粗浅的限制，人脸长宽必须大于100的阀值才认为是正常的人脸。Dlib应该有正统的输出人脸的质量的参数，查了很久，没有找到合适的方法，就只能先这样吧。在比对方面，还有一些重要的概念，没有弄明白，如人脸对齐、年龄、性别检测等，不清楚我的代码里面是否已经有调用已经做了这块。

具体的处理代码：

data = np.frombuffer(data, np.uint8) 
if data is None: 
    raise Exception('image is required.') 

zoom_ratio = 1 
if data.size > 6 * 1024 * 1024: 
    img = cv2.imdecode(data, cv2.IMREAD_REDUCED_COLOR_4) 
    zoom_ratio = 4 
elif data.size > 4 * 1024 * 124: 
    img = cv2.imdecode(data, cv2.IMREAD_REDUCED_COLOR_2) 
    zoom_ratio = 2 
else: 
    img = cv2.imdecode(data, cv2.IMREAD_COLOR) 

faces = [] 
dets = detector(img, 1)

总的来说，开源项目，适合做一下Demo，如果要尽善尽美，那么就要深入到源码，有针对性的去优化检测和比对模型。作为个人的实验和家用还是很不错的。至少在快速编程和服务化这方面。

(5.00分 - 2票)

Loading ... | 同时归档在：WEB网络, 数码硬件, 移动互联, 软件应用 | 标签： jAlbum, Python, REST API, Sqlite, 人工神经网络, 人脸识别 |

一致哈希(Consistent Hashing)简介

作者：童燕群 | 发布日期：八月 4, 2018 | 阅读次数（3,524） | 评论

一致哈希 是一种特殊的哈希算法。在使用一致哈希算法后，哈希表槽位数（大小）的改变平均只需要对 K/n个关键字重新映射，其中 K是关键字的数量n是槽位数量。然而在传统的哈希表中，添加或删除一个槽位的几乎需要对所有关键字进行重新映射。一致哈希的算法最早在如下论文中被提出：

一致哈希在分布式计存储架构中无处不在。是被证明的可以解决经典哈希视图发生变化时，数据搬迁尽可能少的算法。最早是在分布式缓存中提出，参考如下文档，这里提供原文的下载链接：《Consistent Hashing and Random Trees: Distributed Caching Protocols for Relieving Hot Spots on the World Wide Web》。

阅读全文 »

(5.00分 - 4票)

Loading ... | 同时归档在：存储技术, 算法数据结构 | 标签：一致性hash技术, 一致性hash虚拟节点, 分布式缓存 |

PostgreSQL 9.5 架构图及外存图

作者：童燕群 | 发布日期：十月 8, 2017 | 阅读次数（1,850） | 评论

转自阿里云栖社区：链接。点击图片查看原图。

阅读全文 »

(5.00分 - 1票)

Loading ... | 同时归档在：存储技术, 数据库 | 标签： PG |

微信朋友圈技术之道

作者：童燕群 | 发布日期：十二月 16, 2015 | 阅读次数（2,865） | 评论

讲师简介

陈明，微信高级工程师、朋友圈负责人，2012年加入微信后台团队，负责微信后台核心服务的研发，包括朋友圈、即时通信、基础设施等。他获得清华大学计算机系学士和博士学位，研究方向是分布式系统。在加入微信前，他在腾讯搜索和微软亚洲研究院工作多年，内容包括搜索架构与分布式存储等。

概述

截止到2015年7月，微信每月活跃用户约5.49亿，朋友圈每天的发表量（包括赞和评论）超过10亿，浏览量超过100亿。得益于4G网络的发展，以上数据仍有很快的增长，而且相对于PC互联网时代，移动互联网时代的峰值要来得更加凶猛。比如，2015年元月的流量到了平时的2倍，而峰值则达到了平时峰值的2倍，相当于平时正常流量的5倍，这对整个系统的考验是很残酷的。本次分享将简单介绍微信后台团队的开发模式、微信朋友圈的架构以及在性能上的一些工作，供各位参考。

阅读全文 »

(4.73分 - 15票)

Loading ... | 归档目录：架构设计 | 标签：微信架构 |

[转]图解分布式一致性协议Paxos

作者：童燕群 | 发布日期：十月 16, 2014 | 阅读次数（4,637） | 评论

转载自：loop in codes

Paxos协议/算法是分布式系统中比较重要的协议，它有多重要呢？
<分布式系统的事务处理>：

Google Chubby的作者Mike Burrows说过这个世界上只有一种一致性算法，那就是Paxos，其它的算法都是残次品。

<大规模分布式存储系统>：

理解了这两个分布式协议之后(Paxos/2PC)，学习其他分布式协议会变得相当容易。

学习Paxos算法有两部分：a) 算法的原理/证明；b) 算法的理解/运作。

阅读全文 »

(4.92分 - 12票)

Loading ... | 同时归档在：云计算/云存储, 算法数据结构 | 标签： paxos, 大规模分布式 |

Intel芯片架构和指令集演化

作者：童燕群 | 发布日期：十月 15, 2014 | 阅读次数（6,267） | 评论（2）

下载地址：《从芯片架构盘系统优化》

(5.00分 - 10票)

Loading ... | 同时归档在：数码硬件 | 标签： AES, AVX, CPU指令集, CPU架构, CPU缓存, EM64T, SSE3, SSE4, SSE4.2, VT-x, X86 |

[转]MIPS、ARM、X86三大架构

作者：童燕群 | 发布日期：十月 15, 2014 | 阅读次数（7,357） | 评论

转载自：中关村在线

费浙平：RISC领域ARM不是唯一

近两三年，随着手机，平板等智能移动平台的兴起，一个鲜为大众所知的平台逐渐的呈现在了世人的面前。这就是诸如像iPhone 4手机和XOOM平板设备所使用的RISC（精简指令集系统）平台。随着RISC技术的不断进步，这些精简指令系统的设计者也从幕后走到了台前，成为了电子爱好者们了解的对象。不久前，笔者有幸与RISC领域中的专业人士进行了一次深度的交流，从他那里了解到了不少鲜为人知的关于RISC领域的故事。今天笔者通过对这次交流的整理，为大家讲述一名RISC系统技术市场经理眼中的嵌入式系统发展未来。

阅读全文 »

(4.89分 - 9票)

Loading ... | 同时归档在：数码硬件 | 标签： ARM, CISC, MIPS, RISC, X86, 精简指令集, 龙芯 |

OpenStack Swift源码导读之——可插拔的后端设备实现

作者：童燕群 | 发布日期：九月 13, 2014 | 阅读次数（6,836） | 评论

Swift作为一个存储的具体实现出现在OpenStack中，与Cinder的定位有差别，这导致Swift的兼容并包性不够强。必须基于XFS文件系统来存储数据？显然Swift也希望能将数据存储到更多的后端设备中，这样Swift可以与具体的XFS文件系统解耦，作为独立的存储软件存在。这能使得Swift存储的构建更加灵活，同时也能吸引更多的存储厂商投入到其怀抱中。

Swift提供了一种简单机制来实现后端存储设备的pluggable——可插拔的后端。这篇文章想探讨一下该机制。在亚特兰大峰会上面，这一特性是Swift的热门话题之一，对于亚特兰大OpenStack峰会涉及Swift的话题这里有汇总：链接。

阅读全文 »

(5.00分 - 12票)

Loading ... | 同时归档在：Swift, 云计算/云存储 | 标签： Back-end API for Object Server REST APIs, Object Server, Openstack Swift, Swift, Swift源码分析, 可插拔的后端 |

关于

关于本站简介
订阅本站文章列表
建站总结本站建站技术
关注微博
微信公众帐号
shentar
站内搜索
我的项目
近期文章
分类目录
- 生活札记 (51)
  - 奇趣见闻 (12)
  - 文字网摘 (10)
  - 职业发展 (12)
  - 观影随想 (6)
- 软件应用 (15)
- 软件技术 (247)
  - C/C++ (24)
  - IO编程 (16)
  - Java (41)
    - Geronimo (2)
    - Jetty (10)
    - JMX (1)
    - JNI技术 (1)
    - Netty (1)
  - Linux内核 (6)
  - WEB网络 (43)
  - 多线程编程 (16)
  - 存储技术 (51)
    - 云计算/云存储 (41)
      - Amazon S3 (3)
      - Ceph (3)
      - DRBD (6)
      - Hadoop (3)
      - Swift (9)
    - 存储业界 (4)
  - 实用脚本 (21)
  - 建站技术 (22)
  - 数据库 (9)
  - 数码硬件 (29)
  - 架构设计 (29)
  - 移动互联 (52)
  - 算法数据结构 (34)
  - 编程基础 (5)
  - 语言基础 (24)
热度排行
1. [转] 宫崎骏用动漫教给我们的人生哲理，每一句都能说到心里！ - (日期:[八月 24, 2013] 点击:[52,562])
2. Google 网页爬虫报告无法连接站点解决办法 - (日期:[七月 20, 2014] 点击:[38,561])
3. 架设Tiny Tiny RSS（TTRSS）阅读器，找回Google Reader！ - (日期:[九月 27, 2013] 点击:[27,714])
4. SkyDrive、DropBox和Google Drive三大公有云存储服务对比 - (日期:[六月 25, 2013] 点击:[25,493])
5. 升级到至强E5440后，与i5 CPU笔记本性能对比 - (日期:[二月 18, 2014] 点击:[23,542])
6. 公钥私钥加密解密数字证书数字签名详解 - (日期:[四月 19, 2014] 点击:[22,940])
7. 本站建站技术合集 - (日期:[九月 20, 2013] 点击:[22,357])
8. 使用OpenerDNS解决无法访问Google的问题 - (日期:[七月 5, 2014] 点击:[21,671])
9. WordPress博客添加“返回顶部”按钮 - (日期:[七月 14, 2013] 点击:[21,143])
10. Linux文件系统基础之inode和dentry - (日期:[三月 13, 2015] 点击:[20,130])
11. 云存储中的HTTP鉴权算法分析 - (日期:[二月 7, 2014] 点击:[18,616])
12. 精选37条强大的常用linux shell命令组合 - (日期:[九月 4, 2013] 点击:[17,411])
13. 存储基础知识之——磁盘阵列原理及操作实战 - (日期:[二月 9, 2014] 点击:[17,355])
14. DNS原理、架构和配置详解 - (日期:[九月 6, 2013] 点击:[16,770])
15. Netty和Jetty的Java NIO 网络框架模型分析 - (日期:[七月 13, 2013] 点击:[16,317])
16. CoreOS 初识之安装 - (日期:[十一月 16, 2014] 点击:[16,121])
17. Windows与Linux文件系统互访的几种方法 - (日期:[八月 21, 2014] 点击:[15,700])
18. Dijkstra算法求解最短路径分析 - (日期:[七月 12, 2014] 点击:[14,912])
19. NAS解决方案实现多媒体文件共享播放 - (日期:[十二月 21, 2014] 点击:[13,815])
20. 简介 - (日期:[九月 1, 2012] 点击:[13,678])
21. 如何编程实现 2 + 2 = 5？ - (日期:[六月 2, 2014] 点击:[13,245])
22. 搭建了一个iNews程序 - (日期:[十月 15, 2013] 点击:[13,223])
23. 2014年9月曝出的Bash ShellShock漏洞简析 - (日期:[九月 26, 2014] 点击:[13,108])
24. 彻底解决WordPress博客垃圾评论的问题 - (日期:[八月 5, 2013] 点击:[13,056])
25. 如何使用1M的内存排序100万个8位数 - (日期:[三月 27, 2014] 点击:[12,541])
26. 全部日志列表 - (日期:[十一月 11, 2012] 点击:[12,237])
27. 关于回调函数和this指针探讨 - (日期:[八月 24, 2014] 点击:[12,177])
28. 给定一个long型常量，其值为x，给定long型变量a，要求a & x 的取值集合 - (日期:[九月 8, 2012] 点击:[11,681])
29. WordPress建站必备实用插件 - (日期:[八月 7, 2014] 点击:[11,321])
30. Amazon 云计算业务全面介绍 - (日期:[三月 9, 2014] 点击:[11,225])
归档
- 2024年四月 (1)
- 2024年二月 (1)
- 2023年九月 (1)
- 2023年一月 (1)
- 2022年十月 (1)
- 2022年八月 (2)
- 2022年四月 (1)
- 2022年三月 (1)
- 2021年十二月 (2)
- 2021年十月 (2)
- 2021年九月 (1)
- 2021年八月 (1)
- 2021年五月 (1)
- 2021年三月 (2)
- 2021年一月 (2)
- 2020年十二月 (5)
- 2020年十一月 (2)
- 2020年十月 (2)
- 2020年九月 (1)
- 2020年八月 (5)
- 2020年七月 (2)
- 2019年九月 (1)
- 2018年八月 (1)
- 2018年七月 (1)
- 2018年六月 (1)
- 2018年五月 (1)
- 2018年三月 (1)
- 2018年二月 (1)
- 2018年一月 (2)
- 2017年十二月 (3)
- 2017年十月 (4)
- 2017年九月 (1)
- 2017年七月 (1)
- 2017年六月 (1)
- 2016年十二月 (1)
- 2016年十月 (1)
- 2016年九月 (1)
- 2016年七月 (2)
- 2016年六月 (1)
- 2016年二月 (3)
- 2015年十二月 (3)
- 2015年十一月 (2)
- 2015年十月 (1)
- 2015年八月 (2)
- 2015年七月 (4)
- 2015年六月 (1)
- 2015年三月 (2)
- 2015年二月 (1)
- 2015年一月 (4)
- 2014年十二月 (2)
- 2014年十一月 (2)
- 2014年十月 (5)
- 2014年九月 (8)
- 2014年八月 (11)
- 2014年七月 (17)
- 2014年六月 (7)
- 2014年五月 (15)
- 2014年四月 (16)
- 2014年三月 (14)
- 2014年二月 (5)
- 2013年十二月 (5)
- 2013年十一月 (3)
- 2013年十月 (13)
- 2013年九月 (13)
- 2013年八月 (13)
- 2013年七月 (9)
- 2013年六月 (8)
- 2013年五月 (1)
- 2013年三月 (3)
- 2013年一月 (1)
- 2012年十一月 (1)
- 2012年九月 (12)
- 2012年八月 (3)
- 2011年二月 (1)
- 2009年三月 (1)
- 2009年二月 (1)
- 2008年十一月 (1)
- 2008年六月 (1)
- 2008年四月 (1)
- 2008年三月 (1)
内容聚合
- 最近50篇文章
- 最新评论

关于本站	简介
订阅本站	文章列表
建站总结	本站建站技术
关注微博	微信公众帐号 shentar

分类目录： 架构设计

讲师简介

概述

费浙平：RISC领域ARM不是唯一

关于

站内搜索

我的项目

近期文章

分类目录

热度排行

归档

内容聚合

分类目录：架构设计