Podcast Script (zh)
[0.120-13.009] SPEAKER_01: 今天很荣幸邀请到SVM共同发明人瓦特尼克。 他发明了SVM、SVC和VC理论,还写了《统计学习理论》。 他是这个时代最伟大的统计和计算机科学家之一。
[13.089-20.194] SPEAKER_01: 他在苏联长大,后来担任莫斯科控制科学研究所计算机系主任。 所以他今天用俄语讲课,我来翻译。
[20.274-24.999] SPEAKER_01: 翻译,开玩笑的。今天能请到瓦特尼克,非常荣幸。
[25.079-30.326] SPEAKER_01: 请大家热烈欢迎他。谢谢。约50年前,切尔瓦年科教授
[30.626-40.889] SPEAKER_02: 和 我开始研究统计学习。问题是:训练数据表现好时,测试数据是否也表现好? 如果训练数据错误少,测试数据也会表现好。
[40.969-46.715] SPEAKER_02: 你将在测试数据上也表现好,最小化期望误差。我们解决了问题。
[46.795-57.348] SPEAKER_02: 和 这些理论大多以书籍形式传播,用不同语言写成,但 大多数都遵循这个思路:仅靠大数定律不够,还需要
[57.428-67.865] SPEAKER_02: 需要一致大数定律和一致收敛。但我们开始了这场讨论 关于经验误差,你做得有多好 在训练数据上,界限表明 你在训练数据上做得越好
[67.945-72.310] SPEAKER_02: 你在测试数据上就会越好 人们认为这是唯一的方法
[72.390-81.387] SPEAKER_02: 有训练数据就能做点事 用训练数据来减少错误 所有算法都基于这个原则 五年前我发现有一个
[81.467-90.186] SPEAKER_02: 另一个原则比这个更有趣 根据这个暴力原则 数据越多答案越好 第二个原则是智能原则 今天我就聊这个
[90.266-104.827] SPEAKER_02: 先讲统计学习理论 接下来我介绍 零零方程 然后介绍零零方程 然后介绍零零方程 但泛化只有两种方式 一种靠数据,另一种呢 我叫它完整统计学习理论
[104.907-106.660] SPEAKER_02: 因为没有
[106.740-115.702] SPEAKER_02: 还有另一种做法 泛化没有第三种 两个都用上。 所以这理论很完整。 但没那么糟。 但没那么糟。 因为你会发现,学习理论
[115.782-125.998] SPEAKER_02: 往不同方向发展。 在智能的方向上, 理解什么是智能。 这和图灵说的不一样。 图灵说,要模仿一个智能的人。 但问题是,什么是智能。
[126.078-129.421] SPEAKER_02: 我们会讨论这点。 那我们就开始吧。
[129.501-132.589] SPEAKER_02: 那我们就开始吧。 第一部分是泛化理论。
[132.669-134.224] SPEAKER_02: 问题就在这里。
[134.304-142.848] SPEAKER_02: 当你在某组函数中, 你可以最小化这个函数。 这是个很通用的函数。 不是Y,而是F(X),L是损失函数,
[142.928-152.703] SPEAKER_02: 我可以考虑Y和函数的差别。 这就是回归里我们做的。 在模式识别这些内容里。 但这是更一般的设定。 但这点更重要。
[152.783-167.147] SPEAKER_02: 现在考虑函数最小化时, 要说明在哪个函数集合里。 在给定的函数集合里, 我们必须最小化这个函数。 如果概率测度未知, 但有独立同分布的数据对。
[167.227-174.448] SPEAKER_02: 这正是模式识别 和回归估计问题的设定。 模式识别里,函数集合是
[174.528-182.631] SPEAKER_02: 指示函数。 回归里,函数是连续的。 但表述一样。 但答案很简单。 我们现在可以用数据最小化这个函数。
[182.711-186.983] SPEAKER_02: 当且仅当这个函数集合的维度H有限。
[187.063-191.869] SPEAKER_02: 一切看函数集。 现在你得最小化这个函数。 而且躲不开。
[191.949-197.579] SPEAKER_02: 所以我们叫它容量, 其实更应该叫函数集的多样性。 但是
[197.659-202.302] SPEAKER_02: 这种多样性用VC维来量。 那VC维是啥? 我来定义一下。
[202.382-210.102] SPEAKER_02: 先说指示函数集。 T是阶跃函数。 考虑连续函数F。 先得找到指示函数。 如果
[210.182-215.046] SPEAKER_02: 函数为正,输出1。 否则输出0。 这就是指示函数。
[215.126-220.071] SPEAKER_02: 指示函数集的VC维 等于H,如果
[220.151-223.285] SPEAKER_02: H是向量的最大数量。
[223.365-230.830] SPEAKER_02: 可以打散,所有可能方式分开 H子集里的两个 用这个集合的指示函数
[230.910-233.696] SPEAKER_02: 所以你有个集合 你应该
[233.776-245.409] SPEAKER_02: 找到H个向量 你能用各种方式打散它们 L种可能方式里的两个 但你打不散H加一个向量 那函数集合的VC维度就是H 有个纯组合的定义
[245.489-249.401] SPEAKER_02: 如果你能打散任意L个 我们就说VC维度是无穷
[249.481-254.868] SPEAKER_02: 然后我给你两个例子 我们会给出两个定理 我们会用到它们 然后是主要定理
[254.948-256.422] SPEAKER_02: 理论概率
[256.502-264.385] SPEAKER_02: 如果函数集合VC维度是H 那么一减去这个集合的概率 对这个集合里的所有函数,
[264.465-266.438] SPEAKER_02: 这个上界成立。
[266.518-279.312] SPEAKER_02: 而且因为这个上界对所有函数成立, 并且您想要一个最小估计, 您可以这么做。 如果要估计最小右侧, 您会选使经验损失最小的函数。
[279.392-281.040] SPEAKER_02: 而第二个定理,
[281.120-294.494] SPEAKER_02: 如果您有一组线性函数, 来自线性函数集的指示函数, 并且碰巧您的向量X 在半径为1的圆内, 并且W在C内, 那么VC维受限于,
[294.574-299.856] SPEAKER_02: 两个值中的最大值, C和N。 N是向量的维度加一。
[299.936-309.479] SPEAKER_02: 这正好意味着VC维可能小于 空间的维度。 并且您可以用某种方式控制VC维, 我来告诉你怎么做。 这个定理非常重要。
[309.559-323.145] SPEAKER_02: 但是, 什么叫一般性? 一般性方法提出VC维 用来搜索函数。 你有一组函数。 函数集可能有无限VC维。 然后在这个函数集上建个结构。 选一个函数子集,
[323.225-340.004] SPEAKER_02: 一个小函数子集, VC维是H, 然后另一个子集, 包含一个小子集, VC维是H2。 这样很好, 我们有个好函数子集。 这样很好,有个好函数子集。 这个VC维很好。 然后, 当你把这个泛函最小化时,
[340.084-343.996] SPEAKER_02: 其实你在做两件事。 选一个合适的子集,
[344.076-348.708] SPEAKER_02: 然后在这个子集里, 挑出让经验损失最小的那个。
[348.788-349.705] SPEAKER_02: 不过,
[349.785-359.340] SPEAKER_02: 这里的ε取决于VC维, 你在子集中选VC维超过L的。 而且,它还取决于经验损失, 就是你达到的那个值。
[359.420-367.779] SPEAKER_02: 所以你可以, 一旦你搭好一个结构, 想怎么做都行, 哪怕初始函数集合的VC维无限大。 但,
[367.859-375.777] SPEAKER_02: 差不多就是这些, 差不多就是这些, 包含了VC理论的主要结论。 不过,VC理论并没有回答
[375.857-378.910] SPEAKER_02: 但VC理论没回答 四个重要问题。
[378.990-381.938] SPEAKER_02: 得选损失函数L、Y、F。
[382.018-383.666] SPEAKER_02: 任何函数都行。
[383.746-387.240] SPEAKER_02: 选可接受的函数集——F of X。
[387.320-396.561] SPEAKER_02: 我讲过给定函数集, 但我用的函数集很蠢。 要选可接受的函数集——F of X。 得构建好的函数集。
[396.641-402.863] SPEAKER_02: 给可接受的函数集加结构。 然后最小化泛函, 来搭结构。
[402.943-405.938] SPEAKER_02: 今天我会回答所有这些问题。
[406.018-407.991] SPEAKER_02: 目标:最小化泛函。
[408.071-411.043] SPEAKER_02: 这张幻灯片很重要。 上帝掷骰子。
[411.123-418.483] SPEAKER_02: 路径识别问题怎么设? 今天我会考虑 二分类的路径识别问题。 但推广很容易。
[418.563-421.314] SPEAKER_02: 那路径识别问题怎么设?
[421.394-426.339] SPEAKER_02: 给定生成器和自然条件, 我们随机独立地生成X。
[426.419-431.028] SPEAKER_02: 它作用在对象上。 这个对象在X下条件概率是Y。
[431.108-435.334] SPEAKER_02: 假设X条件下Y等于1。 而X条件下Y等于0。
[435.414-439.024] SPEAKER_02: 这个对象知道这个概率。 然后掷骰子。
[439.104-444.374] SPEAKER_02: 所以他有一个条件概率函数。 输入是X。 他掷骰子输出Y。
[444.454-449.457] SPEAKER_02: 这是学习问题最一般的设定。 确定性是这个集合的特例。
[449.537-462.157] SPEAKER_02: 那么学习机器在做什么? 学习机器有一组函数。 它可以从中任选一个函数。 问题是要观察L个观测值。 拿到X1Y1到XLYL,选取
[462.237-464.384] SPEAKER_02: 用于分类的函数。
[464.464-470.013] SPEAKER_02: 这意味着,给定生成的观测值。 条件概率P,XY等于P。
[470.093-481.644] SPEAKER_02: 给定X时Y的概率。 这就是全部方案。 找到最小化函数的规则。 所以当y为0或1时,或者, θ为0或1时是指示函数。
[481.724-489.885] SPEAKER_02: 最后一个函数只收集做错次数。 但我有概率测度。 它收集误差的期望。 我想找一个函数, 让误差期望最小。
[489.965-491.718] SPEAKER_02: 但这并不好。
[491.798-497.986] SPEAKER_02: 为什么不好? 因为我现在用的这个模型, 它处处为零, 除了在一些点是1或-1。
[498.066-503.569] SPEAKER_02: 所以用这个模型,输出为1。 所以它处处为零且已定义,
[503.649-513.633] SPEAKER_02: 并且在某些点为1。 所以这里不能用梯度。 所以我得选更聪明的做法。 可人们实际在做的, 是用模型和指示函数来替换
[513.713-517.544] SPEAKER_02: 只用y减f(x),最小平方误差,
[517.624-525.112] SPEAKER_02: 而不是我原先定下的那些。 这个选择其实不赖,因为正好 这个函数的最小值现在就能给出
[525.192-535.246] SPEAKER_02: 条件概率函数。 也就是给定x时y等于1的概率。 然后当我们算出这个概率 后,就能轻松构建 我们的决策规则。
[535.326-537.439] SPEAKER_02: 我们只需考虑函数:
[537.519-544.926] SPEAKER_02: 如果条件概率大于0.5, 就判为第一类。 如果小于0.5,就判为第二类。 这就是最优解。
[545.006-547.235] SPEAKER_02: 但这次替换有问题。
[547.315-549.486] SPEAKER_02: 我们重写一下,这是第一行。
[549.566-552.201] SPEAKER_02: 我先从括号里的第一项减去。
[552.281-556.971] SPEAKER_02: 先回归,再奇数回归。 所以我用两个括号,不是一个。
[557.051-564.934] SPEAKER_02: 然后我做个平方。 最后一个积分显示了第一个积分。 不依赖于我要找的函数。 我必须在 f 上最小化泛函。
[565.014-569.425] SPEAKER_02: 在一组函数上,只对最后两项求和。
[569.505-573.533] SPEAKER_02: 我怎么得到的? 这只是个普通的二项式四次方。
[573.613-577.757] SPEAKER_02: 第一个的平方。 第二个的平方。 还有两个相乘的项。
[577.837-580.983] SPEAKER_02: 但我们的目标是最小化第一个积分。
[581.063-591.001] SPEAKER_02: 找一个接近的, 条件概率函数的函数。 不是两个积分的和。 我们可以证明第二个积分最后趋于零。 但它让收敛速度变慢。
[591.081-602.017] SPEAKER_02: 要加快收敛速度, 我们要找到让第一个积分最小的办法。 不是这两个加起来。 也就是说,不是最小平方损失, 而是别的什么。 我们能怎么办?
[602.097-603.525] SPEAKER_02: 存在,
[603.605-615.482] SPEAKER_02: 首先,什么时候,为什么? 没错,存在。 所以,比如,0 或 1, 给定X时Y等于1的概率 是一个在0到1之间的实函数。
[615.562-626.103] SPEAKER_02: 因为根据贝叶斯公式, 我们知道概率, 给定X时Y等于1的条件概率 在X的密度P下,就是给定X时Y的联合密度, X。
[626.183-628.319] SPEAKER_02: 这总是成立。
[628.399-633.669] SPEAKER_02: 现在,如果乘以某个函数, G(X) 减去 X_star,
[633.749-637.475] SPEAKER_02: 它属于L2空间, 再取积分,就得到这个方程。
[637.555-640.979] SPEAKER_02: 條件概率就是解, 方程的解。
[641.059-644.449] SPEAKER_02: 它是這樣構造的, 因為你看,我放了條件概率,
[644.529-653.166] SPEAKER_02: 我做了類似的事。 但我想解這個方程, 來找函數,但我不懂概率測度, 但我有數據,給定觀測值,
[653.246-656.311] SPEAKER_02: 根據 P X, P Y X 生成。
[656.391-659.676] SPEAKER_02: 我想解這個方程。 但解方程是個不適定問題。
[659.756-661.184] SPEAKER_02: 好了,我們來做。
[661.264-665.106] SPEAKER_02: 但在那之前, 我想提到,經典統計學中,
[665.186-666.892] SPEAKER_02: 有一種方法,
[666.972-678.802] SPEAKER_02: 必須 替換未知概率測度, 用經驗測度。 這是最重要的部分。 這是統計學中的主要歸納步驟。 统计学里,我们拿到数据, 想找出函数。
[678.882-686.718] SPEAKER_02: 不管看多少数据, 它都不等于函数。 经典统计学里,人们建议 用经验累积分布函数近似
[686.798-694.379] SPEAKER_02: 累积分布函数。 这就是经验累积分布函数。 30年后, 数学家想证明这主意不错, 就是能这么做。
[694.459-703.642] SPEAKER_02: 33年,科尔莫戈罗夫找到精确界限, 写在最后一行。 几乎跟最后一行一样。 然后人们证明了存在这个界限。
[703.722-709.062] SPEAKER_02: 现在,用经验测度替代 未知测度, 就能构建问题,
[709.142-715.887] SPEAKER_02: 问题就是该做什么。 在想要的泛函里替换, 用经验测度替代真实测度来最小化。
[715.967-718.962] SPEAKER_02: 我们有经验最小二乘根泛函,
[719.042-722.466] SPEAKER_02: 必须最小化它来解决我们的问题,
[722.546-737.618] SPEAKER_02: 从而找到条件概率。 决策规则,或者其他你想要的。 但让我考虑一个新的构造设定。 其中,我们也用经验概率测度 替换未知的概率测度, 这些测度来自训练数据。
[737.698-743.723] SPEAKER_02: 你会看到最后一个方程。 要找到条件概率, 必须解这个方程, 而不是函数f(x)。
[743.803-751.581] SPEAKER_02: 右边是已知的, 因为函数g已知。 左边,我们不知道f(x), 所以在这个函数集中,目标是 找到这个函数。
[751.661-753.855] SPEAKER_02: 在经典统计学中,
[753.935-767.056] SPEAKER_02: 有一种算法叫Watson-Nadarayev估计量。 来演示一下怎么估计条件概率。 回到一个回归函数。 他们就是用了某种方式 来定义这个函数。 定义这个。 而这是,
[767.136-773.544] SPEAKER_02: 我给出的函数是, 有个分母,还有个分子。 所以g是特殊核函数,比如高斯核。
[773.624-787.012] SPEAKER_02: 这就是对回归的一个估计, 一种很通用的回归估计方法, 针对条件概率的。 所有这些工作都得找出, 如果是高斯分布,就得找出, 方差的最佳值,
[787.092-799.305] SPEAKER_02: 才能很好地近似条件概率。 所以他们花了很多时间在这上面, 最后得到了这个结果。 但你能看到中间那条线。 这就是Watson-Nadarayev-Watson估计器。
[799.385-811.215] SPEAKER_02: 这个方程来自污染。 不是我们推导的那个方程。 它在这里,中间位置。 中间是 f(x), 不是 f(ξ), 像上个,是正确那个。 你可以拿出某个 f(x),
[811.295-818.516] SPEAKER_02: 就会得到这个函数。 所以就是经典的W-N-W估计量。 它就是污染方程的解。
[818.596-820.825] SPEAKER_02: 但解方程意味着什么?
[820.905-826.431] SPEAKER_02: 解方程就是取一个差值, 在左边和右边之间。 定义函数作用的区域。
[826.511-830.237] SPEAKER_02: 取平方后在概率测度上积分,
[830.317-832.731] SPEAKER_02: 并最小化这个函数。
[832.811-840.775] SPEAKER_02: 那我们就来做。 如果做简单代数运算, 很简单,你可以验证。 就会得到这个 f 函数。 这是 y 减 f(x)。
[840.855-843.885] SPEAKER_02: y_j 减 f(x)_j。
[843.965-847.378] SPEAKER_02: 乘以系数 yx 和 yxj。
[847.458-848.212] SPEAKER_02: 所以,
[848.292-854.398] SPEAKER_02: 我们估计这个值。 这个值等于 jxyxi jxi xj 除以测度。
[854.478-861.246] SPEAKER_02: 这是矩阵。 若你知道 Watson-Nadarayev 精确公式, 我们知道这个矩阵。 矩阵的元素。
[861.326-861.941] SPEAKER_02: 所以,
[862.021-869.219] SPEAKER_02: 什么是 V 矩阵? 如果你替换这个积分, 这个经验积分, 我们得到这个矩阵的估计。 如果只用,比如说,
[869.299-875.359] SPEAKER_02: 负一到正一的线段, 且 nu(x) 在线段上均匀分布, 我们就得到,
[875.439-881.522] SPEAKER_02: 并且我们就得到。 而且g是高斯分布 我们会有这个V矩阵 所以V矩阵很好找
[881.602-888.045] SPEAKER_02: 现在我想用向量表示 我把它叫做y向量 数据元素y1到yl 我得到l对数据,
[888.125-890.969] SPEAKER_02: y向量包含所有y
[891.049-896.877] SPEAKER_02: 我会定义大写F 它也是l维向量 我取函数f 这是函数在x1的值
[896.957-900.265] SPEAKER_02: 最后是函数在xl的值
[900.345-908.564] SPEAKER_02: 所以这就是f 我还有V矩阵 所以我能重写泛函 用矩阵形式 y减大写F V乘以y减大写F
[908.644-920.521] SPEAKER_02: 但用这种记法,最小二乘 y减F,F是大写。 y减F,F是大写。 这里,代替y。 这里,代替y。 我改了单位矩阵。
[920.601-923.352] SPEAKER_02: 所以我改进了最小二乘法。
[923.432-925.045] SPEAKER_02: 而且我希望,
[925.125-928.631] SPEAKER_02: 收敛速度更好。 比这个最小二乘。 但是,
[928.711-940.393] SPEAKER_02: 让我们看看。 这没什么大不了。 因为,好吧。 我改进了收敛速度。 但这个平方网络还不错。 但现在最关键的是, 选择可容许函数集。 这意味着什么?
[940.473-942.760] SPEAKER_02: 构建神经网络时,
[942.840-955.892] SPEAKER_02: 你说你在搞智能结构。 这是什么意思? 你说你在构建 一个巧妙的可容许函数集。 你知道吗,你们都很聪明。 你只是在构建, 然后在这个函数集上最小化。
[955.972-958.642] SPEAKER_02: 但让我从理论角度想。 它是什么?
[958.722-961.589] SPEAKER_02: 如果你想希尔伯特空间,
[961.669-966.312] SPEAKER_02: 和欧几里得空间, 这个空间里有两种收敛方式。
[966.392-972.777] SPEAKER_02: 强收敛。 这是函数的收敛。 这是第一行。 我的函数序列 fL 收敛到 f0。
[972.857-976.769] SPEAKER_02: 如果 fL 在积分里收敛,当 fL 趋向无穷。
[976.849-978.578] SPEAKER_02: 但还有弱收敛。
[978.658-988.781] SPEAKER_02: 你说我的函数序列 fL 收敛到 f0。 如果这个内积收敛到那个内积。 对希尔伯特空间的所有函数 phi。 你光靠思考就行。
[988.861-992.611] SPEAKER_02: 这是函数的内积性质。 所有函数性质都一样,
[992.691-995.523] SPEAKER_02: 那就收敛了。 有个规模服务区。
[995.823-998.098] SPEAKER_01: 有些地方F1固定。
[998.398-1001.544] SPEAKER_02: 所以如果有强收敛,很容易证明。
[1001.624-1007.730] SPEAKER_02: 那也有弱收敛。 来自沃森和施瓦茨不等式。 就是柯西-施瓦茨不等式。
[1007.810-1011.153] SPEAKER_02: 但也能证明,有弱收敛的话,
[1011.233-1018.117] SPEAKER_02: 而且函数集在紧集里, 那也有强收敛。 所以这两种收敛等价。 在机器学习中,
[1018.197-1024.861] SPEAKER_02: 我们考虑处处强收敛,百分之百。 那弱收敛呢? 我们探索这个机会。
[1024.941-1030.142] SPEAKER_02: 我们考虑路径识别的情况。 对于路径识别, 我刚在写弱收敛的定义。
[1030.222-1033.089] SPEAKER_02: 等于第二个,就是用了贝叶斯方程。
[1033.169-1039.415] SPEAKER_02: 来自dp的φ等于φ分之一。 对所有来自φ的函数。
[1039.495-1046.054] SPEAKER_02: 所以它对所有φ的函数必须收敛。 如果它对所有φ的函数收敛,
[1046.134-1053.123] SPEAKER_02: 就会得到所需的函数。 但这不现实。 我们来做下面的事。 从希尔伯特空间选m个φ函数。
[1053.203-1058.009] SPEAKER_02: 再细说怎么选这些函数。 然后我们考虑一个等式,
[1058.089-1061.455] SPEAKER_02: 不是对所有函数,只对这m个。
[1061.535-1066.527] SPEAKER_02: 我们叫它可容许函数集。 就是满足这个等式的函数集。
[1066.607-1069.358] SPEAKER_02: 我们知道函数必须满足
[1069.438-1073.385] SPEAKER_02: 这个等式对任何φ, 因为V收敛。
[1073.465-1075.937] SPEAKER_02: 但我们选我们想要的。
[1076.017-1078.849] SPEAKER_02: 好的。 如果要用我们的替代方案。
[1078.929-1085.233] SPEAKER_02: 累积分布函数 还有它的经验估计, 我们会用积分性质的替代,就像这样。
[1085.313-1090.258] SPEAKER_02: 这个性质, 用求和表示。 我再用同样的矩阵符号。
[1090.338-1100.276] SPEAKER_02: 我用 y 向量。 我用函数 f,大写 F。 即 f(x1), f(xl),这是个向量。 对任何函数 f,我都有一个向量。 另外,我引入一个新向量。
[1100.356-1106.219] SPEAKER_02: 预测向量。 预测向量给出 x1, xl 的值。 因为 φ 是一个函数,
[1106.299-1111.569] SPEAKER_02: 这时我可以考虑函数的值。 然后我把方程写成这种形式。
[1111.649-1117.117] SPEAKER_02: 我希望可容许函数集满足 这 m 个方程用向量形式表示。
[1117.197-1118.207] SPEAKER_02: 现在。
[1118.287-1120.423] SPEAKER_02: 我来解释一下我们在说什么。
[1120.503-1122.476] SPEAKER_02: 有种鸭子测试逻辑。
[1122.556-1130.392] SPEAKER_02: 如果它看起来像鸭子,游泳也像, 还像鸭子一样嘎嘎叫, 那它就是只鸭子。 那它很可能就是只鸭子。
[1130.472-1144.255] SPEAKER_02: 就是说,我们有统计不变性。 向量形式里,它就是这条直线。 它用来收集可接受函数, 这些函数把动物识别为鸭子, 如果它看着像、游着像、叫起来也像鸭子。
[1144.335-1159.511] SPEAKER_02: 所以,如果你选谓词, 它解释了“看起来”“游泳”和“嘎嘎叫”的意思。 那在你的可接受函数里, 就会有个函数,这样的函数, 它归类那些会游泳、会嘎嘎叫的, 还有看起来像鸭子的动物。
[1159.591-1173.618] SPEAKER_02: 谓词和特征很不一样。 为什么呢? 因为看着像鸭子的动物越来越多, 只是个谓词。 谓词的数量,VC维 可容许函数集的VC维会减少。 为什么会减少? 因为我们有个函数集,
[1173.698-1178.759] SPEAKER_02: 然后我们从这函数集中, 挑出满足新谓词的函数。
[1178.839-1183.668] SPEAKER_02: 不是所有函数都满足, 而且只考虑函数集 它满足所有谓词。
[1183.748-1189.251] SPEAKER_02: 但随着特征数增加, VC维也增加, 因为决策越来越多样化。
[1189.331-1192.837] SPEAKER_02: 那完整学习问题的确切设定是?
[1192.917-1196.620] SPEAKER_02: 最小化泛函,就是带V矩阵的,
[1196.700-1202.121] SPEAKER_02: 是对最小二乘泛函的小改进, 受这个约束限制。
[1202.201-1206.972] SPEAKER_02: 而这个约束就是, 你想看到的 在可容许函数集中。
[1207.052-1218.766] SPEAKER_02: 但现有经典模式识别方法, 它们只最小化这个函数, 即最小二乘函数。 所以我们在最小化这个函数, 满足约束,这就是设定。
[1218.846-1221.040] SPEAKER_02: 这就是精确的设定。
[1221.120-1224.510] SPEAKER_02: 这在数学上被称为
[1224.590-1228.223] SPEAKER_02: 条件优化。 在约束条件下优化函数。
[1228.303-1230.833] SPEAKER_02: 但近似是无条件优化。
[1230.913-1241.396] SPEAKER_02: 我想在满足约束前提下最小化这个函数, 但我会这样做: 我会对这个函数求和, 然后我会取, 这个约束差值的平方,
[1241.476-1252.888] SPEAKER_02: 再加上一定权重求和。 权重取1。 所以我想同时做这两件事, 对两者都最小化, 再加上权重, 最小化数据对我有多重要
[1252.968-1256.172] SPEAKER_02: 约束最小化也同样重要
[1256.252-1259.642] SPEAKER_02: 那如果我这样做 我就能重写这个函数
[1259.722-1262.949] SPEAKER_02: 你得把这个泛函最小化
[1263.029-1266.279] SPEAKER_02: 这里的P就是谓词协方差矩阵
[1266.359-1269.609] SPEAKER_02: 而且计算起来很简单
[1269.689-1277.026] SPEAKER_02: 所以基本概念就是这样 接下来我们要做的 就是解决这个问题 用大收敛和强收敛 这就要用到不变性
[1277.106-1279.451] SPEAKER_02: 同时最小化泛函
[1279.531-1282.201] SPEAKER_02: 可以精确做到
[1282.281-1294.590] SPEAKER_02: 也能近似实现 但这是针对任意函数集的 我没讲具体怎么最小化 这就像最小二乘法 你可以最小化最小二乘泛函 对任何函数集都适用 这里也一样。
[1294.670-1296.666] SPEAKER_02: 现在,我来看看。
[1296.746-1298.835] SPEAKER_02: 怎么找解决方案。
[1298.915-1302.583] SPEAKER_02: 首先,我来做。 关于再生核希尔伯特空间。
[1302.663-1313.425] SPEAKER_02: 这就是再生核希尔伯特空间定义。 有些核,就是梅瑟核。 你相乘,取乘积。 与f(x)相乘,得到相同函数。 它再生相同函数。
[1313.505-1324.546] SPEAKER_02: 它叫再生核希尔伯特空间。 而且已知这个核, 梅瑟核有关于λ的展开, 其中λ是非负值。 而ψ是正交归一函数。
[1324.626-1328.213] SPEAKER_02: 因此,有内积和范数的函数集。
[1328.293-1335.317] SPEAKER_02: 这是内积,那是范数。 构成再生核希尔伯特空间。 这很好验证。 这就是说,如果你使用
[1335.397-1339.669] SPEAKER_02: 一些,一些, psi函数,正交的psi函数,
[1339.749-1343.301] SPEAKER_02: 还有c的展开, 如果你有这组函数,
[1343.381-1345.586] SPEAKER_02: 如果你引入特殊内积,
[1345.666-1347.233] SPEAKER_02: 这种内积,
[1347.313-1353.280] SPEAKER_02: 那你就得到这个定义。 所以,你就得到再生核希尔伯特空间。 这个空间相当一般。
[1353.360-1357.353] SPEAKER_02: 但在再生核希尔伯特空间中, 有个重要定理叫表示定理。
[1357.433-1372.458] SPEAKER_02: 表示定理说, 如果你想最小化这个函数, 在函数子集中, 还有函数子集, 你的函数范数在再生 在核希尔伯特空间中有界。 你的解是线性函数形式。
[1372.538-1377.425] SPEAKER_02: 你的解具有线性表示形式 在核上,参数数量有限。
[1377.505-1381.614] SPEAKER_02: 介绍矩阵和函数的向量
[1381.694-1386.036] SPEAKER_02: f k x 是 x 的一个,是展开向量
[1386.116-1388.287] SPEAKER_02: 范数的平方是 a
[1388.367-1396.192] SPEAKER_02: 这是 x 的一个,范数的平方是 a 这是 x 的一个,范数的平方是 a 这是 a 除以 k 就是这样
[1396.272-1400.405] SPEAKER_02: 这就是你要找的函数的样子 A k a 是范数
[1400.485-1404.571] SPEAKER_02: 再生核希尔伯特空间的函数
[1404.651-1416.644] SPEAKER_02: K 是矩阵 k x i x j 这是再生核希尔伯特空间的 f 这是再生核希尔伯特空间的 f 这是再生核希尔伯特空间的 f 所以只是线性函数
[1416.724-1422.668] SPEAKER_02: 有界范数的函数子集 还有有限的 VC 维 C 越小,VC 维越小
[1422.748-1426.033] SPEAKER_02: 根据第二个定理 我之前展示过的
[1426.113-1435.517] SPEAKER_02: 而且VC维度,只要控制C就行。 你只要控制C。 得找到这个函数的范数。 得找到这个函数的范数。 这个函数。
[1435.597-1445.755] SPEAKER_02: 所以生成时,条件最小化就行。 核希尔伯特空间有闭式解。 现在在这个约束下最小化这个函数。 还有对范数的约束。
[1445.835-1451.361] SPEAKER_02: 这样就能得到解。 它是这个函数向量的线性组合。 系数的值就这样。
[1451.441-1457.663] SPEAKER_02: 它只是闭式形式。 跟矩阵和矩阵乘法有关。 这是gamma C,C依赖这个。
[1457.743-1462.944] SPEAKER_02: 你会看到gamma或C依赖这个C吗? 这是单位矩阵。 或者你有这个解。
[1463.024-1471.441] SPEAKER_02: 要找到这里的mu,就得解线性方程。 你得解线性方程。 所以你在解线性方程 然后你得到闭式解
[1471.521-1477.627] SPEAKER_02: 所以再生核希尔伯特空间里的完整问题 核希尔伯特空间有闭式解
[1477.707-1487.970] SPEAKER_02: 但是无条件最小化呢, 像那样近似最小化? 在这个约束下。 它也有闭式解。 这就是闭式解的样子。 你的解是这个展开上的系数。
[1488.050-1490.998] SPEAKER_02: 然后你有这个方程来找A。
[1491.078-1493.608] SPEAKER_02: 所以一切都是可计算的。
[1493.688-1513.311] SPEAKER_02: 但它们在解释中角色很特殊。 但它们在解释中角色很特殊。 但它们在解释中角色很特殊。 但它们在解释中角色很特殊。 支持向量机。 但它们在解释中角色很特殊。 什么是支持向量机? 给定数据,我想要,
[1513.391-1515.782] SPEAKER_02: 在再生核希尔伯特空间里,
[1515.862-1519.170] SPEAKER_02: 用有界范数最小化这个函数。
[1519.250-1536.284] SPEAKER_02: 当我最小化这个函数时, 那就是你得到的支持向量机。 那就是你得到的支持向量机。 那就是你得到的支持向量机。 注意观察就能推导出支持向量机, 它就是在最小化这个函数。 在这个函数集合里。
[1536.364-1541.031] SPEAKER_02: 但这里我要做点别的。 我像支持向量机那样处理数据。
[1541.111-1551.025] SPEAKER_02: YI减去AKA。 YI减去AKA。 我希望近似数据是个范数, 就像这里一样。 但我也想替换数据。 我也希望我的不变量
[1551.105-1560.648] SPEAKER_02: 会足够好,会接近。 左边和右边 不变量会互相接近。 所以我现在想最小化这个函数 在相同约束下 这就是解 解类似于A
[1560.728-1567.357] SPEAKER_02: A是从T取5的函数 而且从T取5,你记得 它是谓词向量
[1567.437-1572.464] SPEAKER_02: 这是指示向量 如果我想加强不变量
[1572.544-1577.385] SPEAKER_02: 近似函数则别太强 我只想 只用弱收敛
[1577.465-1579.519] SPEAKER_02: 我的A由不变量定义
[1579.599-1582.095] SPEAKER_02: 由谓词函数定义
[1582.175-1586.401] SPEAKER_02: 但我的谓词函数 如何选谓词 我能选任何想要的函数
[1586.481-1591.624] SPEAKER_02: 我就可以选一个函数 它会给我最优解 有如此聪明的谓词
[1591.704-1593.433] SPEAKER_02: 这样我就不用大量数据。
[1593.513-1601.152] SPEAKER_02: 需要什么?为什么需要数据? 我需要数据做核扩展。 但估计系数,我不需要数据。 我用谓词,意思是,
[1601.232-1612.807] SPEAKER_02: 这到底是什么? 谓词是什么意思? 它是一个属性。 它关于我想的解释。 我稍后再讨论。 所以这个支持向量机例子 表明这种学习理念很不同。
[1612.887-1623.022] SPEAKER_02: 根据代表性定理, 学习问题的解 在RKHS中有一个性质。 它定义了线性参数函数。 以核函数展开形式。
[1623.102-1627.606] SPEAKER_02: 这意味着最优展开属于单层。 网络,不是多层网络。
[1627.686-1630.356] SPEAKER_02: 但由于RKHS
[1630.436-1633.744] SPEAKER_02: 比这更丰富, 也许用起来不是最好的主意。
[1633.824-1637.910] SPEAKER_02: 深度网络。 深度网络,嗯,我们后面再聊这个。
[1637.990-1646.314] SPEAKER_02: 观测向量和核搭出了展开的基础, 用来找到最优参数。 但参数是由不变量决定的。
[1646.394-1648.890] SPEAKER_02: 不过你可以用这些不变量。
[1648.970-1653.021] SPEAKER_02: 也就是说,如果你写成这样, 就会有个矩阵K,
[1653.101-1665.094] SPEAKER_02: 它取决于你的训练数据, phi是谓词矩阵,所以这里有个向量。 这是Y和F,Y是向量,F也是向量, 于是你有不同的元素,
[1665.174-1667.646] SPEAKER_02: 不同的学习问题表达方式,
[1667.726-1670.976] SPEAKER_02: 全都跟着这个向量和这些值走。
[1671.056-1674.504] SPEAKER_02: 所以希尔伯特空间里的简单函数可以,
[1674.584-1677.556] SPEAKER_02: 因为能用那个空间里的任何函数。
[1677.636-1687.156] SPEAKER_02: 因为说到弱收敛时, 它对所有函数同时收敛。 希尔伯特空间。 所以任何函数都能用。 我们能挑几个智能函数, 甚至就一个,
[1687.236-1692.599] SPEAKER_02: 训练用它就够了。 接下来聊智能的含义。 这是智能学习,不是蛮干。
[1692.679-1696.069] SPEAKER_02: 举个例子感受一下。 最小二乘法的用途。
[1696.149-1698.157] SPEAKER_02: 这是V矩阵法。
[1698.237-1704.425] SPEAKER_02: 要是稍作改进, 它会好一些。 引入不变量,效果更好。 同时用不变量和V矩阵。
[1704.505-1708.731] SPEAKER_02: 可以看到48个点的差异。 为了确保是难题,
[1708.811-1713.373] SPEAKER_02: 从一类取了16个, 另一类取了32个。 不相等。
[1713.453-1718.062] SPEAKER_02: 98个点也一样。 这是一百九十二个点,同样的故事。
[1718.142-1724.504] SPEAKER_02: 这是多维情况。 所以我们检查了一些东西,并且做到了。 而那是一个非常有趣的案例。
[1724.584-1727.312] SPEAKER_02: 我们引入了一些不变量,
[1727.392-1751.290] SPEAKER_02: 并且DI的错误率达到了两千两百七十三。 而那是一个非常有趣的案例。 我们引入了一些不变量,并且DI的错误率达到了两千两百七十三。 我们引入了一些不变量,并且DI的错误率达到了两千两百七十三。 然后我们决定, 我们能否找到不变量来提高性能? 我们所做的,就是寻找区域
[1751.370-1754.934] SPEAKER_02: 在那里我们的不变量不起作用。 它们违反了它。
[1755.014-1766.531] SPEAKER_02: 然后我们取了一个谓词, 它只针对这个区域, 当你的...时计为1, 当你的...时计为1, 当点属于这个区域时, 否则为0。
[1766.611-1774.656] SPEAKER_02: 我们用这个不变量来改进 我们用这个不变量来改进 从点七三到点七 从点七三到点七
[1774.736-1778.288] SPEAKER_02: 所以如果你有聪明办法
[1778.368-1780.515] SPEAKER_02: 来找不变量
[1780.595-1786.098] SPEAKER_02: 那就有机会提升表现 但这正是同样的思路 物理学家用的
[1786.178-1789.684] SPEAKER_02: 在图里找方案盒子 里面已有的方案
[1789.764-1795.348] SPEAKER_02: 找到那个盒子的情况 里面的近似值方案 这结果跟证据矛盾
[1795.428-1796.739] SPEAKER_02: 没保持不变量
[1796.819-1806.757] SPEAKER_02: 跟盒子里的不变量矛盾 然后改方案,得到新近似值 它解决了这个矛盾 它没有这个矛盾 你就是在找,在发明不变量 然后找找矛盾的地方。
[1806.837-1816.821] SPEAKER_02: 这其实就是同样的原则。 物理学家用它发现自然规律。 要发现自然规律, 他们先找一些情况, 理论与观察结果不符。
[1816.901-1822.543] SPEAKER_02: 不变量方法中,理论预测 得不到实验支持。 不变量方法就是这么回事。
[1822.623-1835.161] SPEAKER_02: 然后他们重建理论, 消除矛盾。 他们构建新的理论近似, 让矛盾消失。 但物理里最重要的, 像这里,更难的部分。 科学发现里,
[1835.241-1837.748] SPEAKER_02: 必须找到矛盾的情况。
[1837.828-1842.135] SPEAKER_02: 但我讲讲神经网络。 我不太喜欢它。 但也能把理论用上去。
[1842.215-1848.159] SPEAKER_02: 什么是神经网络? 那就是神经网络。 你在最小化最小二乘误差。
[1848.239-1858.037] SPEAKER_02: 我会最小化... 存在一个近似不变量, 它包含VP矩阵,也就是V加P。 矩阵P就是那个不变量矩阵。
[1858.117-1865.663] SPEAKER_02: 然后我做同样的反向传播。 正好我能轻松做反向传播, 不只针对这个矩阵,还有这个。
[1865.743-1869.469] SPEAKER_02: 如果我要做反向传播, 里面只需要改一次。
[1869.549-1879.626] SPEAKER_02: 而不是反向传播误差, Y减最后一层的输出, 你有全部L个观测值, 只有这个矩阵, 然后传播向量乘上它。
[1879.706-1884.094] SPEAKER_02: 你在修正传播过程。 这就是反向传播的内容。
[1884.174-1894.971] SPEAKER_02: 前向步骤,没问题,一样。 反向传播这一步,其实是边界条件。 反向传播时,要做一些修正, 只在最后一层, 然后更新状态。
[1895.051-1901.134] SPEAKER_02: 所以我到NSE,问那些搞神经网络的人, 就加这个改进,只加这一个。
[1901.214-1904.081] SPEAKER_02: 一个小改进,我只取了一个不变量。
[1904.161-1915.692] SPEAKER_02: 这个不变量很平常。 Psi(X)等于一,等于一。 但我要说,这个不变量没那么简单。 我们来聊聊这个不变量能干啥。 然后我们说V等于Y,没用到V矩阵。
[1915.772-1921.333] SPEAKER_02: 这里它就是单位矩阵。 用一千个样本,每类一百个,批次大小六。
[1921.413-1925.104] SPEAKER_02: 也就是说,这条线是神经网络做的,
[1925.184-1928.655] SPEAKER_02: 深度神经网络,他们有个不错的深度网络。
[1928.735-1938.893] SPEAKER_02: 这就是改进神经网络的方法。 而不是三。 而不是3.1,他们得到了3.?2.9。 好的。 我们只做个不太重要的余弦系数。
[1938.973-1941.120] SPEAKER_02: 我有张数字图片。
[1941.200-1944.148] SPEAKER_02: 我做余弦展开。 所以我有四年系数,
[1944.228-1955.501] SPEAKER_02: 取一个四年系数。 然后我会, 把这个用作谓词。 所以拿这个系数当谓词。 再看,只有一个不变量, 这个傻乎乎的余弦带来了改进。 好。
[1955.581-1963.359] SPEAKER_02: 然后我们多做点。 做16个四年系数。 四个来自X,四个来自X1,四个来自X2。
[1963.439-1965.354] SPEAKER_02: 得到了0.6。
[1965.434-1969.404] SPEAKER_02: 改进更大了。 但怎么做都行。 比如做1600个不变量。
[1969.484-1975.544] SPEAKER_02: 可以玩很多花样。 但在神经网络里, 我们用精确解的近似, 但它很有效。
[1975.624-1979.118] SPEAKER_02: 所以,学习理论的统计部分就完整了。
[1979.198-1981.566] SPEAKER_02: 为什么说它完整?
[1981.646-1985.674] SPEAKER_02: 因为收敛只有两种方式 在希尔伯特空间里。
[1985.754-1989.086] SPEAKER_02: 函数收敛。 泛函收敛。 没有第三种了。
[1989.166-1995.725] SPEAKER_02: 所以,从概念上讲, 你可以玩一个或两个游戏,或者两个游戏, 一起。
[1995.805-2000.332] SPEAKER_02: 所以,我为什么说它完整? 你想不出别的了。 如果你想做
[2000.412-2002.223] SPEAKER_02: 某件事,
[2002.303-2007.527] SPEAKER_02: 那是改进学习, 你得问自己怎么选不变量。 这正是我们要聊的。
[2007.607-2008.559] SPEAKER_02: 而且,
[2008.859-2009.927] SPEAKER_01: 不变量。
[2010.227-2012.676] SPEAKER_02: 不变量跟智能有关。
[2012.756-2013.905] SPEAKER_02: 当我讲
[2013.985-2015.738] SPEAKER_02: 鸭子测试,
[2015.818-2021.146] SPEAKER_02: 说它长得像鸭子,游得像鸭子, 叫得像鸭子。 但我可以说它下棋像鸭子。
[2021.226-2022.781] SPEAKER_02: 什么都能说。
[2022.861-2025.914] SPEAKER_02: 而且它应该是不变等式。
[2025.994-2028.803] SPEAKER_02: 或者说,像狗一样唱歌剧,对吧?
[2028.883-2030.972] SPEAKER_02: 这些傻乎乎的谓词里,
[2031.052-2039.329] SPEAKER_02: 有个聪明的谓词, 还有学习的主体, 以及智能学习的主体, 有人得掌握这种聪明的恒等性。
[2039.409-2051.741] SPEAKER_02: 咱们聊聊什么是谓词。 这个我不太懂。 我觉得这是个几百年的故事。 我要告诉你,这延续了 从柏拉图、黑格尔到维格纳的主要哲学。 等等,我演示给你看。
[2051.821-2060.702] SPEAKER_02: 但它不是谓词。 我认为,不谈模仿的时候, 而是智能的本质是什么。 本质就是谓词。 谓词是抽象的东西。
[2060.782-2063.916] SPEAKER_02: 好,稍后我演示给你看。 我们来看谓词。
[2063.996-2066.306] SPEAKER_02: 即,这个不变式成立。
[2066.386-2068.835] SPEAKER_02: 那么取 f(x) 等于 1。
[2068.915-2070.726] SPEAKER_02: 这个谓词是干嘛的?
[2070.806-2077.493] SPEAKER_02: 类别y的期望元素数等于1, 用这个谓词计算, 等于第一类训练样本数。
[2077.573-2080.301] SPEAKER_02: 使用这个谓词时,
[2080.381-2084.444] SPEAKER_02: 你会选一个函数,它会给你 在这个训练数据上,
[2084.524-2090.793] SPEAKER_02: 表示第一类的数量完全一样 就像你的训练数据一样。 所以,这就是这个谓词。
[2090.873-2097.432] SPEAKER_02: 这个用于神经网络的谓词很强吧。 还有十类数字识别,因为它们有点东西。
[2097.512-2103.642] SPEAKER_02: 再看一个很傻的谓词。 只是个x,看起来像个点。 这是质心。
[2103.722-2109.910] SPEAKER_02: 我想要那个期望的质心。 期望是条件概率的。 那就等于平均值。
[2109.990-2112.938] SPEAKER_02: 等于训练数据里看到的质心。
[2113.018-2114.933] SPEAKER_02: 那看起来像个点。
[2115.013-2117.543] SPEAKER_02: 但你可以更聪明,看起来像个点。
[2117.623-2121.071] SPEAKER_02: 所以我可以考虑x和x的转置。
[2121.151-2127.919] SPEAKER_02: 构成矩阵。 它是相关矩阵和变异矩阵。 可以看到。 n的平方除以二这种谓词。
[2127.999-2130.553] SPEAKER_02: 用这个谓词得到的协方差。
[2130.633-2134.081] SPEAKER_02: 用函数…不对,预测,会得到。
[2134.161-2140.105] SPEAKER_02: 得到的解是一样的。 就像训练数据里吸收的协方差。 意思是这个谓词。
[2140.185-2142.634] SPEAKER_02: 所以我们没必要追求一般谓词。
[2142.714-2154.335] SPEAKER_02: 可以想象很多谓词,我没那么聪明。 去构造非常一般的谓词。 但针对二维图像谓词来做。 比如 u、x1、x2,两个变量的函数。 它是数字图像。
[2154.415-2164.550] SPEAKER_02: 在我们例子里可以说。 我们有函数 y,就是这个 y。 考虑类似取图像这样的谓词。 我会考虑超过四维的系数。 这就是我的谓词。
[2164.630-2171.398] SPEAKER_02: 我想要这个谓词的期望值。 会和我看到的训练数据一样。 我可以考虑卷积。
[2171.478-2174.171] SPEAKER_02: 卷积神经网络就是一个谓词。
[2174.251-2176.178] SPEAKER_02: 我来展示这个谓词。
[2176.258-2179.206] SPEAKER_02: 这是点 x、y、x 的卷积。
[2179.506-2180.481] SPEAKER_01: 不同点的。
[2180.781-2186.969] SPEAKER_02: 你可以用小波,或者任何你想要的。 不管什么进内积, 由你决定用什么。
[2187.049-2195.512] SPEAKER_02: 还有对图像识别的理解。 意思是要搞懂涉及哪个谓词。 同时注意谓词和不变量的区别。
[2195.592-2197.763] SPEAKER_02: 谓词是抽象概念。
[2197.843-2200.350] SPEAKER_02: 而不变量涉及训练数据。
[2200.430-2204.876] SPEAKER_02: 它把你的抽象概念具体化。 它既通用,又具体。
[2204.956-2207.243] SPEAKER_02: 这就是我希望你展示的。
[2207.323-2209.772] SPEAKER_02: 特殊谓词的工具。
[2209.852-2217.177] SPEAKER_02: 考虑向量x,y,x,z。 只是数字识别。 记住你的数字识别。 假设x是你的像素空间。
[2217.257-2221.146] SPEAKER_02: 你做线性变换。 你的像素空间的小线性变换。
[2221.226-2231.547] SPEAKER_02: 如果你有像素空间的小线性变换, 你就变换你的图像。 但你可以变换图像,也可以变换 用导数。 我告诉你那是什么。 但要知道那是什么,
[2231.627-2234.633] SPEAKER_02: 我拿了Simart他们论文的这张图。
[2234.713-2236.721] SPEAKER_02: 这是变换,第一行。
[2236.801-2250.991] SPEAKER_02: 在像素空间里做线性变换。 而在这里做同样的变换。 用线性导数。 这是线性导数,黑色的。 它只是在算线性导数。 我来演示怎么算。 alpha是系数。 再用不同的系数,
[2251.071-2253.660] SPEAKER_02: a等于负二。 你这样做。
[2253.740-2258.024] SPEAKER_02: a等于负一。 你可以得到这个、这个、这个,全部。
[2258.104-2260.356] SPEAKER_02: 所以你能复制数字2。
[2260.436-2262.711] SPEAKER_02: 这就是用导数做的变换。
[2262.791-2265.043] SPEAKER_02: 你不用。 你不需要太多数据。
[2265.123-2274.260] SPEAKER_02: 数字识别,你得有。 你得有谓词。 而且任何数据你都能得到这个谓词。 然后,好的,我来展示这个谓词的不变性。
[2274.340-2282.745] SPEAKER_02: 这就是线性导数。 它是水平平移。 X,第一个坐标加A。 你只要沿A方向移动它。 一。
[2282.825-2285.437] SPEAKER_02: 然后,垂直变换。 这是旋转。
[2285.517-2289.661] SPEAKER_02: 这是标准的旋转几何公式。 针对小旋转。 你有那个。
[2289.741-2295.963] SPEAKER_02: 这是d, d, x。 这是d, d, x, 2等等。 你有这个和所有这些。
[2296.043-2299.247] SPEAKER_02: 这也来自Patrice Simard的插图。
[2299.327-2308.522] SPEAKER_02: 克隆。 这三个归你了。 然后把这些克隆全做出来。 直接选一二三四五就行。 导数带了不同的系数。 这些材料都齐了。
[2308.602-2312.688] SPEAKER_02: 这家伙挺聪明。 为啥不像谓词那样, 直接对这个求导?
[2312.768-2328.896] SPEAKER_02: 然后对这个取不变量。 再对这个取不变量。 再对这个取不变量。 再对这个取不变量。 从这个角度看。 但要是对导数取不变量, 我想用统计不变量来学, 试着估计这类条件概率, 它对导数保持不变。
[2328.976-2334.223] SPEAKER_02: 再进一步, 这个又完成了。 假设我有这个, 这是我的一组数字克隆。
[2334.303-2336.369] SPEAKER_02: 这是另一组数字克隆。
[2336.449-2351.335] SPEAKER_02: 切线距离就是两克隆中最接近的元素。 从这两组克隆里。 我有两个数字, 它们不同,比如二和三。 我用线性变换处理它们, 让它们尽量靠近, 再量它们有多接近。
[2351.415-2354.305] SPEAKER_02: 这叫不变量。 这叫切线距离。
[2354.385-2359.272] SPEAKER_02: 我觉得这就是谓词和对称的一般概念。 谓词和对称。
[2359.352-2361.360] SPEAKER_02: 当你有一张图片时,
[2361.440-2368.243] SPEAKER_02: 可以问对称性怎么度量, 对这两张图。 比如,你有个三。 我能做的是,这是我的数字三。
[2368.323-2377.599] SPEAKER_02: 我会做四次水平对称。 我就取第一行, 这里是第二行,最后一行。 然后我这样做。 我再做一个数字。 我把最后一行变成第一行。
[2377.679-2381.429] SPEAKER_02: 这一行是第二行。 所以我正在做的是这个。
[2381.509-2384.341] SPEAKER_02: 我取三个,像向量那样读。
[2384.421-2385.895] SPEAKER_02: 现在我要这样做。
[2385.975-2388.064] SPEAKER_02: 这是两张不同的图像。
[2388.144-2393.008] SPEAKER_02: 现在我来处理它们。 这个切线距离,两张不同图片。 它们有多接近。
[2393.088-2402.550] SPEAKER_02: 如果很接近,我可以这么说。 这是三的对称系数。 但我可以说,水平对称, 垂直对称,反对称。 反对称是什么意思? 数字S。
[2402.630-2405.462] SPEAKER_02: 它具有垂直反对称性。
[2405.542-2411.927] SPEAKER_02: 还有对角线对称等等。 所以,对称性可以玩出很多花样。 这只是一个谓词。
[2412.007-2416.151] SPEAKER_02: 我有结论和备注。 我们做的就是最小化这个函数。
[2416.231-2418.425] SPEAKER_02: 这比平方稍好一点。
[2418.505-2425.192] SPEAKER_02: 这个约束很严格,受它限制。 因为这个约束定义了容许集。 我试图巧妙构造它。
[2425.272-2434.014] SPEAKER_02: 所以,考虑所有连续函数。 然后从这些连续函数中。 用巧妙谓词选出容许集。 我能做到,基于弱收敛。
[2434.094-2436.590] SPEAKER_02: 任何不变量在任何谓词下都成立。
[2436.670-2446.666] SPEAKER_02: 所以这也提供了唯一解。 对于再生核希尔伯特空间。 神经网络的一种近似。 近似解。 但进一步进展超越了统计推理。
[2446.746-2462.596] SPEAKER_02: 它朝着搜索谓词的方向发展。 这构成了理解问题的基础。 存在于世界上。 那理解到底是什么意思? 这就意味着在... 在... 比如识别二维图像时, 就有对称这个概念。
[2462.676-2470.477] SPEAKER_02: 还有结构这个概念。 如果你明白这个概念, 我觉得不算多。 我告诉你为啥我觉得不算多。 你明白这个问题。
[2470.557-2480.112] SPEAKER_02: 所以我觉得这条思路, 这是非常古老的思路。 它从柏拉图开始的。 柏拉图说了什么呢? 他说有个理念的仓库, 还有个事物的仓库。
[2480.192-2483.338] SPEAKER_02: 理念的仓库造就了事物的仓库。
[2483.418-2484.764] SPEAKER_02: 但你看,我有理念,
[2484.844-2489.975] SPEAKER_02: 这是谓词,是抽象的。 我能用在不同的情况。 但我有很多东西。
[2490.055-2492.284] SPEAKER_02: 但到公元300年左右,
[2492.364-2505.927] SPEAKER_02: 六十年前,那是德国古典哲学。 理念是什么,事物是什么。 黑格尔说,凡是合理的,都是存在的。 这就是他关于谓词说的。 凡是存在的,都是合理的。
[2506.007-2507.957] SPEAKER_02: 所以有两个联系。
[2508.037-2513.482] SPEAKER_02: 但六十年前,维格纳写了篇文章。 关于数学有效性不合理。
[2513.562-2515.988] SPEAKER_02: 他说数学能了解现实。
[2516.068-2520.073] SPEAKER_02: 如果你想理解现实, 看方程,就知道它怎么运作。
[2520.153-2523.125] SPEAKER_02: 所以谓词是抽象理念。
[2523.205-2528.533] SPEAKER_02: 基于它们构建的不变量, 构成了解决方案的元素。
[2528.613-2529.959] SPEAKER_02: 只是概念。
[2530.039-2534.265] SPEAKER_02: 反映智力的本质。 不只是模仿,那是人工智能。
[2534.345-2539.848] SPEAKER_02: 但这是必须攻克的课题。 另外,我还有两张幻灯片。 第一张是挑战。
[2539.928-2554.118] SPEAKER_02: 我知道,做深度网络的人。 用六万观测值实现0.5%错误率。 挑战是用其中1%的数据。 并得到相同结果。 但要发明智能谓词和所有现有克隆。
[2554.198-2556.090] SPEAKER_02: 我觉得它很持久。
[2556.170-2561.278] SPEAKER_02: 最后一张幻灯片,1928年,弗拉基米尔·普罗普。
[2561.358-2569.519] SPEAKER_02: 出版了《民间故事形态学》。 他描述了31个谓词。 能合成所有俄罗斯民间故事。
[2569.599-2579.792] SPEAKER_02: 后来,他的形态学,也就是这31个谓词, 被用在文学、戏剧、电影、 电视、电视剧、游戏等等。 这31个就够了。
[2579.872-2584.260] SPEAKER_02: 我从维基百科读到的。 你可以查维基百科,莱登博布。
[2584.340-2589.703] SPEAKER_02: 普罗普发现了31个描述不同动作的谓词。 现实世界的人
[2589.783-2594.566] SPEAKER_02: 它们可能只有少量谓词 描述图像的那些
[2594.646-2597.920] SPEAKER_02: 那就是智能 那就是找到它们的方法
[2598.000-2601.529] SPEAKER_02: 那就是我觉得该学的 谢谢
[2601.829-2604.743] SPEAKER_01: 我们还有时间回答几个问题
[2605.043-2605.995] SPEAKER_00: 你好谢谢
[2606.075-2613.540] SPEAKER_00: 我有两个问题 首先你知道有什么谓词 你推荐做语言分类用的 具体来说 第二,你有什么策略 防止过拟合 比如你指定太多谓词可能会 有点过度
[2613.840-2617.845] SPEAKER_02: 我没听清 哦 但第二个是关于过拟合
[2618.145-2619.491] SPEAKER_00: 过拟合,没错。
[2619.791-2626.013] SPEAKER_02: 好,我来答这个问题。 当然。 谓词越多,为啥会过拟合? 因为函数集合太大。
[2626.093-2631.839] SPEAKER_02: 选择函数时,数据太少。 所以能选任何函数。 但如果增加谓词数量,
[2631.919-2646.840] SPEAKER_02: 函数集合就变小了。 所以谓词越多,过拟合越少。 好想法。 而且,有一种理论, 数学上说,如果有无限多个 谓词,就只剩一个函数, 就是你想要的函数。
[2647.140-2653.583] SPEAKER_01: 你还问到自然语言。 关于语言的谓词建议。 自然语言处理,图灵测试。 有什么好谓词吗?
[2653.883-2658.410] SPEAKER_02: 你知道,这很复杂。 这故事特复杂,讲自然语言。 我不知道。
[2658.490-2662.599] SPEAKER_02: 有问题吗? 你知道,不管我说什么, 它都特别琐碎简单。
[2662.679-2664.931] SPEAKER_02: 但二维图像大家都熟悉。
[2665.011-2671.001] SPEAKER_02: 你可以像这个人一样思考,弗拉基米尔·普罗克。 这些图像里的谓词是什么?
[2671.081-2676.909] SPEAKER_02: 你能说出来吗? 如果你聪明,就说几十个, 或者一打,谓词,就够了。
[2677.209-2678.846] SPEAKER_01: 但语言比图像难多了。
[2679.146-2680.492] SPEAKER_02: 哦,是的。
[2680.572-2683.462] SPEAKER_02: 对,但别一上来就当难题。 试试看。
[2683.762-2684.679] SPEAKER_01: 试试看。
[2684.979-2687.765] SPEAKER_02: 对,我试了,很简单,一步步来。
[2687.845-2688.878] SPEAKER_02: 碰巧呢,
[2688.958-2690.931] SPEAKER_02: 哲学的主流呢,
[2691.011-2694.076] SPEAKER_02: 从柏拉图到这个人, 谁说想法太多啊?
[2694.156-2697.964] SPEAKER_02: 思想的世界里,想法再多也不多。
[2698.044-2699.657] SPEAKER_02: 可能就是那样吧。
[2699.957-2704.008] SPEAKER_01: 弗拉基米尔,谢谢你能来。 来,大家为他鼓掌!
[2704.088-2707.617] SPEAKER_01: 字幕来自Amara.org社区