机器学习基础整理
时间不多,所以不做过多整理了。
部分数学
先验概率P(Wj)
后验概率P(Wj|x)
类条件概率密度p(x|wi)
类条件概率密度,即类别状态为 时的x的概率密度函数
决策树:
信息熵和信息增益:
计算举例:
CLS:随机选择
ID3: 选出信息增益最大的属性,信息增益偏向于可能值较多的属性
信息增益率:属性A对数据集S的信息增益与数据集S关于属性A的信息熵的比
C4.5:先从候选划分属性中找出信息增益Information Gain高于平均水平的属性,再从中选择增益率GainRatio最高的
CART:基尼系数
矩阵的卷积运算:卷积核矩阵翻转180°,被卷积矩阵外围补充0构成m+n维,每个位置相乘求和
名词解释主动学习
主动学习是机器学习的一个子领域,在统计学领域也叫查询学习或最优实验设计。主动学习方法尝试解决样本的标注瓶颈,通过主动优先选择最有价值的未标注样本进行标注,以尽可能少的标注样本达到模型的预期性能。
监督学习(Supervised learning)
数据集中的每个样本有相应的“正确答案”, 根据这些样本做出预测, 分有两类: 回归问题和分类问题。
无监督 ...
数值计算
专业词汇interpolate 插值
polynomlal 多项式
monomial 单项式
iterative 迭代
equation 方程
equivation 等效
convergent 收敛
normal equations 正规方程组
orthogonal projector 垂直投影
科学计算适定问题(well-posed problem)
需要满足如下三个条件:
a solution exists, (解存在)the solution is unique, (解唯一)the solution’s behaviour changes continuously with the initial conditions. (解能根据初始条件连续变化)
绝对误差、相对误差:
误差界:
向前误差、向后误差:
截断舍入、最近舍入:
误差分类:数据误差、计算误差(截断误差(假设没有舍入,方法产生的误差)、舍入误差)
敏感性&病态性:问题是敏感的&病态的:输入有误差,输出会有较大误差
量化:条件数,条件数大称为病态的
相对条件数的计算:
函数与其反函数的条件数互为 ...
数据仓库数据挖掘知识梳理
1 数据分析的基本步骤有哪些?每个步骤的主要工作
2 关于大数据的4V理论是什么?数据规模大从TB跃升到PB甚至EB。
数据类型多越来越多非结构化数据;音频、 食品,地理位置信息等多类型数 据对数据处理能力提出更高要求。
数据价值高海量数据带来了巨大的商业价值。数 据之间关联性支持深层的数据挖掘。
数据处理速度快 对数据实时处理有着极高的要求, 通过传统数据库查询方式得到的 “当前结果”很可能已经没有价值。
3 四种基本度量尺度适用的集中趋势和离散度量方法有哪些?按照对事物计量的精确程度,可将所采用的计量尺度由低级到高级分为四个层次:定类尺度(Nominal Level)定序尺度(Ordinal Level)定距尺度(Interval Level)定比尺度(Ratio Level)
定类数据:众数定序数据:中位数定距和定比数据:平均数(均值)众数、中位数和均值的比较
数据的离散程度即衡量一组数据的分散程度如何定类数据:异众比率定序数据:四分位差定距和定比数据:方差和标准差相对离散程度:离散系数
4 数据对象的相似性有哪些方法
5 数据属性的相关性有哪些方法(斯皮尔曼等级相关系数,皮尔 ...
随笔
今天太晚了,本来想每天发布一篇技术博客看来今天做不到了。好消息是开学终于有消息了,虽然你软院明天才开会但是我已经从其他学院的同学那里得到了确切消息。终于可以回学校了,考研,期末,都需要好好准备,家里确实没有学习环境。
想一想明天该做的事,计划一下。原神已经抽光原石卸载了,王者也删掉了,要是刷视频再刷到就减少王者推荐,免得让我又想下载了玩。抖音过段时间也卸了吧,本来也就不是我习惯用的软件,而且刷起来确实有点上瘾。说起游戏,荒野大镖客2前几天下回来我的电脑居然帧数贼低,原来玩得好好的,绝对是游戏的问题或者win11的问题,纯纯负优化了,也无所谓,本来也就基本上通关了。
明天就整理整理linux的知识点或者数据仓库数据挖掘的知识点,尽量做做考研数学的书,一定好好努力不能再摆烂了!胡适之啊胡适之,你怎么能天天打牌呢。眼瞅着这寒假就结束了,大部分时间都在玩和浪费时间,和计划的相去甚远啊。然后今天12点之前睡觉,明天早点起床,调整作息,从现在开始。
要有紧迫感,要记住自己要做到的事,要弥补过去的遗憾,实现自我价值。
Nosql理论基础
学习Nosql过程中对基础知识的整理。这门课最后考了97分,排名第三。
数据一致性•一致性模型强度排序如下:
• 线性一致性 > 顺序一致性 > 因果一致性 > { 写后读一致性/自读自写一致性,单调读/写一致性,前缀一致性,先读后写一致性}
•强一致性•也叫即时一致性
•假如应用1先写入了一个值到存储系统,存储系统保证后续应用1、应用2、应用3对于该值读取操作都将返回最新值
•弱一致性•假如应用1先写入了一个值到存储系统,存储系统不能保证后续应用1,应用2,应用3对于该值的读取操作能读取到最新值。
•最终一致性•最终一致性是弱一致性的一种特例
•假如应用1首先写了一个值到存储系统,存储系统保证如果在应用1,应用2,应用3后续读取之前没有其它写操作更新同样的值的前提下,最终所有的读取操作都会读取到应用1写入的最新值
•不一致性窗口:从应用1写入到后续操作应用1,应用2,应用3读取到最新值这一段时间
•此种情况下,如果没有失败发生的话,“不一致性窗口”的大小依赖于以下的几个因素:交互延迟,系统的负载,以及复制技术中replica的个数(这个可以理解为master/sa ...
python编程复习题
大二上学期lfb老师面向大数据的python开发课程中一些简单编程题目的记录。
1.生日攻击生日攻击是一个著名的概率问题,在分析hash函数安全性问题时有用,是类比这样一个问题:随机选取至少多少个学生,才能使这些学生中有两个同学生日一样的概率不少于一半。用python代码写程序,用多次随机试验的方法找这个人数的下限。
生日攻击python代码验证程序
>>
123456789101112131415161718>import random>days_in1year = 365>try_and_loop = 10000>for g in range(1,365):#range函数是常用于遍历数字的内置函数>hit=0>for loop_i in range(0,try_and_loop):#0到9999 对于每个人数 实验10000次 看成功多少次 即为概率>birthdays=set([])>for o in range(0,g):#o为0到当前实验次数,即多少个人 birthday1 = random.randint(1, ...
Nosql实验--租房总数据
目录
实验一 熟悉实验环境和实验数据
实验二 设计 MongoDB 数据库、集合和文档
实验三 将实验数据插入数据库中
实验四 使用交互式命令完成查询
实验五 使用高级程序设计语言进行数据统计(本实验是选做题)
实验一 熟悉实验环境和实验数据1、熟悉华为 GaussDB for MongoDB 数据库的操作。
2、下载并了解实验数据。
由于没有弄清楚openguess和guessdb for mongo的区别,尝试用dbeaver连接的错误尝试:
华为云手册中使用1.4版本的robo 3t,官网的robo 3t升级成了Studio 3T,界面有了很大不同,对着教程操作困难。前往github下载之前发行的版本:
根据教程连接上云数据库后,发现自己无法创建数据库,使用shell执行use命令后无法插入文档。
插入文档报错:not master
解决:连接的ip是从节点,更换公网ip至主节点。
了解实验数据:
每个文档包含_id、base_info(基本信息)、city、configuration(配置条件)、district(行政区域)、lease_mode(出租模式,整租或者合 ...
python100个关键词
这篇博客是我在大二上学期lfb老师的面向大数据的python开发课程时对老师给出的关键词进行查找总结的成果。100个关键词在下方分别列出含义(以字母顺序)。
.appendappend() 方法用于在列表末尾添加新的对象。
append()方法语法:
1list.append(obj)
obj — 添加到列表末尾的对象。
该方法无返回值,但是会修改原来的列表。
以下实例展示了 append()函数的使用方法:
12345#!/usr/bin/pythonaList = [123, 'xyz', 'zara', 'abc'];aList.append( 2009 );print "Updated List : ", aList;
以上实例输出结果如下:
1Updated List : [123, 'xyz', 'zara', 'abc', 2009]
.py是文件名的后缀,用于标识文件类型,.py文件通常是由python语言编写的程序脚本
.p ...
