晚上看到18if在B站的第二话选择性下架了.
然后追述了下原因看到知乎上的这个话题.
https://zhihu.com/question/62443727
然后想了几点.
如果把这些回答/猜测/解释作为广电的一种官方意见放出来的话.
是一种什么样的感受.
这里的一个点其实是自我审查与审查的区别.
形态上来说,自我审查和审查其实算是同一类决策思路.
不同的只是一种半主动半被动和主动的区别.
自我审查被人诟病的一点就是审查范围的无限制和边界的浮动.
当然,这一点可以说是审查制度本身的主观性太强客观尺度不成文造成的.
但从客观上来说,也反映了审查不管是主动还是被动都存在一种尺度飘忽的问题.
也就是应该审查什么的问题.
或者说什么是应该被审查的问题.
审查的目的是什么呢?
某种程度上来说,审查是一种对内容的剪裁技术.
广义上来说,导演的剪辑以及重剪版本都可以算是一种审查.
目的是对内容的重新规划和限定.
就像东邪西毒原版和后来的重新剪辑版一样.
前者是用零碎表征零碎.
后者则是纯粹的故事线索梳理.
所试图呈现的侧面和重点的区别.
当然,用这个类比多少是有些诡辩味道的.
但不管怎么样,内容操纵这点是共同的.
那么内容操控的目的是什么呢.
像剔除血腥暴力色情等.
具体来说是剔除什么呢?
这个某种程度上来说也是伪命题.
因为就表现手法和目的来说,有些恰恰就是为了表现这些想要控制的内容.
如果说剔除这部分算是制度正确的话.
那么对于那么并不以表现血腥暴力色情等内容为目的,而只是恰巧使用了对应手法的类别呢?
退一步来说,也可以说因为不是必要手段,可以使用其他表现方式.
那么这里有什么问题么?
问题在于执行的尺度.
就色情来说.
什么程度算色情呢?
就好像某段子一样.
内衣和泳衣的区别界限.
这个虽然调侃意味比较浓,但也多多少少能说明一些问题.
由于存在个体的接受广度深度方面的差异,人与人之间对内容的容忍和划分程度也是不同的.
即使是放大到人群当中,群体之间的差异也是明显的.
就像所谓的二次元文化,甚至于这些二次元文化下面的各层次的次级文化之间,也常常有冲突.
所以客观上来说,可能并不存在一个所谓的广泛的社会道德层面的尺度agreement.
有人觉得分级制度可能解决审查问题的.
需要考虑的矛盾点也就在此.
纯粹以年龄层面来分级的话,对于各种不同的表现手法适用度是有限的.
而且对于作品思想的表达接受能力,可能并不跟年龄有直接关系.
如果使用含代考核评测性质的分级制度的话,可能又不是一些群体认可的符合普世价值的解决方案.
因此,分级制度的矛盾点在于,制度可以很好地解决内容接受度和定向传播.
但问题在于,它的核心在于将如何控制内容的定向传播转变为了如何对内容进行定向分级.
一个类似纯粹的概念变换.
并没有提供具体真实的解决方案.
回到审查本身.
审查的目的是一种内容控制.
从形式上来说,是一种过滤机制.
过滤本质上来说,是一种选择性的内容许可.
借用generative adversary network的思路的话.
其实就是用审查过滤这种negative sampling去辅助objective function的拟合.
也就是说内容审查和过滤只是作为内容定向的一种实现方式realization而已.
反过来说,实际目的其实是定向的内容输送.
中立地说,纯字面意义的中国梦正能量爱国情怀等并不是什么难堪的东西.
如果社会确实这个所述的话也并没什么太大的问题.
那么,这里的问题冲突在哪里呢?
一方的强行灌输也就意味着一方的抵抗.
抵抗的点无非在于不切实际或者说有些自欺欺人或者其他因素带来的不现实性.
某种形式的所谓的人民群众日益增长的物质文化需求与落后生产力之间的矛盾.
形式上来说.
就是如何将两种objective function约束在一起求解的问题.
比如要复兴国学礼义廉耻,那么在教育层面作为一种升学指标.
解决人口结构附带的社会抚养问题,那么可以将社保公积金组合加在房地产方面.
科研自主能力方面,就附带地提升国内期刊的地位和重要性等.
所以,与其说是一种objective function的糅合.
不如说是一种政治经济学上的拉格朗日乘数.
在一个社会国家层面,给定一个目标之后.
剩下的不过是一种诱导变化.
2017-07-23
2017-07-16
信用货币与计划经济
考虑货币作为一种信用媒介.
比较传统或者所古典的理论当中,货币是当作一种所谓一般等价物处理的.
也即使作为交易当中的一个通用中介符号.
现代理论中,货币的产生是作为一种信贷扩张的结果.
它跟传统的区别在于,前者的产生或者说需求数量依赖的是交易的频率/频度.
或者说货币乘数周转率之类的.
体现在交易过程中的出现频率.
而信贷理论的基础是一种借记关系.
或者所谓的记账式.
一个可能比较贴切的例子就是所谓的月饼券.
在一定周期内完成的纯记账式的债务权利交割.
至于里面有没有涉及到具体的实物清算或者说参与,则不在理论框架范围内.
这里有一个问题.
那就是这种定义下的货币的存在意义.
考虑AB两方参与的一个交易.
最后的结果无非是AB交换一下账目所有.
"货币"在里面的作用不过是一个价格计量性质的单位.
把它去掉并不会影响交易的成功与否.
本质上,就是原始的以物易物.
放在任何双方参与的合理理性的交换行为当中,这种交易里面的"货币"存在意义是很微弱的.
因为在这种情况下,都可以规约回两两交易的对等交换情况下.
这种情况下的货币不过是一种公共计价方式.
但公允么?
考虑物品X从A到B到C的一个交易链条.
以物物交换的角度看,不过是X的所有权由A->C的一个转换过程.
考虑.
A->B的交换是B以一个溢价Y得到的.
即在A->B的实际交易价格是X+Y.
B->C的交换是C以一个溢价Z得到的.
即在B->C的实际交易价格是X+Z.
那么考虑,X+Y = X+Z
->
Y = Z么.
不一定.
因为B C对溢的private valuation并不总是相同.
也就是说,如果把货币考虑为这些信用交换过程中的一个计量单位的话.
可能并不具有任何现实意义.
因为价值估计是一个个体差异相当大的东西.
也就是说,这种计量并不具有公允性.
也就是说,存在C直接跟A交换X的话,付出的要比通过B交换来得少或者多.
这个会有什么问题呢?
只要交易始终是你情我愿的,那么这种计量浮动/偏差有什么影响呢?
考虑公允价值的市场性质.
公允价值或者说具体价值是作为一个某种特定商品交换的计价的一个体现.
简单说,就是一种类似的平均价格的存在.
它的作用是为同类交易做一种计量锚定作用.
约束同类交易尽可能地在同水平附近浮动.
在纯信用记账的范畴内,这个问题在于平均水平是受制于具体的交易的.
也就是说,这个平均价格是以某个时期内的实际发生的交易作为一个参照系得出的.
一个直观的例子就是股票市场的交易价格的形成.
里面价格的波动除了受买卖双方的预期影响之外,更多的是由实际的买卖行为决定的.
一个极端的例子就是,即便说都预期某个股票的价值应该低于某一点的话.
但只要有足够的买入流动性,也依然能够推高价格.
所以,如果以信贷作为货币理解的基础的话,那么流动性是一个隐含的必要因素.
另外一个极端的例子就是,当市场上某种产品只有一次交易成立的话.
那么其价格就有可能被认为是一种公允/平均价格.
这点是跟传统的一般等价物概念有很大区别的.
某种程度上来说,货币在这里不过是一个复杂的记账传递网络里的一个数值化体现.
它并不需要一定是对等的,或者说反映供需关系.
本质上来说,有点类似于一个单向的拟合预测函数.
基于过去的数据给出当前的一个估计.
至于是否符合实际的曲线,那就是另外一回事了.
然后基于这个思路考虑一下信贷扩张问题.
或者更确切地说固定资产或者说房地产的问题.
一个成交就意味着对市场公允价格的一次加权调整.
以资产证券或者数值化的角度看的化,随之而来的就是同等/同类资产所有者的一次重新计量过程.
也就是说,但一个200w的房子以300w的价格成交的时候,拥有同等同类房子的人资产就增加的100w.
换算成百分比的化就是50%.
那么,以记账方式考虑的话,全社会的货币就相应地在账目上增加了50%.
具体的实现方式可能是抵押/在抵押贷款等,创造出新的货币账目.
当然,实际是并不是所有的增加账目都会马上变现进入流动.
但从纯账目上来说,以公允价值计量的话,就是相当于再发行了50%的货币.
而也正因为并不是所有的新发行都会马上变成现金流进入传统意义的流通领域,所以才没有通胀的事实感觉.
某种形式的滞后效应.
考虑变现的一部分.
如果把没有进入流通的"增发"考虑为实际的增发的话,即假设只有N%的进行了变现.
那么流通领域就增加了这N%的现金.
对于这部分人来说,就是实现了固定资产向现金资产的一个转换.
假设市场永远是滞后的或者说变现的永远是少数一部分人.
那么这部分人相当于在不断的自行发新钞.
因为实际上的效果就相当于把账目推入流动领域.
那么,能无限的增发下去么?
实际上的货币供应量还是受制于对应的货币政策的.
也就是说,这里存在一个转移的上限.
因为上面的增发游戏本质上是对现有资产负债表做的一种定向腾挪.
由买房者向房产所有者做的一个现金和固定资产的交换.
一个极端的结果就是代表流动性的现金资产集中在一部分人手里.
而另一部分人持有的是等额的低流动性资产.
也就是一种事实上的一部分人有资产而无现金.
于是,考虑经济发展的信贷扩张理论.
它要求的是通过提高负债率,提高消费周转的效率,进而带动经济链条的发展.
然而上面的无流动资产的情况则是,扩张信贷的对无现金人群并无任何实际刺激.
而对于现金持有者来说,边际效用是递减的.
因此这种情况下的一个必然现象就是扩张的疲惫或者说所谓的滞涨.
即无论如何宽松,也没办法再对经济周转效率产生积极的影响.
而由于缺乏现金,各个资产层级之间理论上就存在一个"增发"能力的上限.
也就是说,由于资产数量的差异,和现金的缺乏,使得到了阶层内的一定位置之后.
拥有的现金不在具有往上一层级靠拢的趋势.
或者说,存在一个"增发"能力的效率/增长率差异带来的曲线上的分段函数表征.
即所谓的阶级固化.
这会有什么问题么?
由于存在现金流动资产的层级隔离,而由于没个层级内的现金资产的边际效用是递减的.
那么理论上就存在一个分布使得每个层级的天花板层级对"增发"的追逐动机依次下降.
这样的话,动态地考虑,层级内和层级间从长期来看是不太可能有一个稳态的.
所谓的经济周期变动.
回过头来.
这里问题的本质是信用机制下面,货币记账的不对等性造成的.
即脱离了一般等价物锚定的货币,更多的是受到各个零碎交易结果影响的.
而且由于交易的不对称性和人的决策最优解定义的差异性,整个动态系统基本上是很难可控可预测的.
所有,某种程度上来说.
求解于计划经济的某些思路,也不是一件离谱的事情.
比较传统或者所古典的理论当中,货币是当作一种所谓一般等价物处理的.
也即使作为交易当中的一个通用中介符号.
现代理论中,货币的产生是作为一种信贷扩张的结果.
它跟传统的区别在于,前者的产生或者说需求数量依赖的是交易的频率/频度.
或者说货币乘数周转率之类的.
体现在交易过程中的出现频率.
而信贷理论的基础是一种借记关系.
或者所谓的记账式.
一个可能比较贴切的例子就是所谓的月饼券.
在一定周期内完成的纯记账式的债务权利交割.
至于里面有没有涉及到具体的实物清算或者说参与,则不在理论框架范围内.
这里有一个问题.
那就是这种定义下的货币的存在意义.
考虑AB两方参与的一个交易.
最后的结果无非是AB交换一下账目所有.
"货币"在里面的作用不过是一个价格计量性质的单位.
把它去掉并不会影响交易的成功与否.
本质上,就是原始的以物易物.
放在任何双方参与的合理理性的交换行为当中,这种交易里面的"货币"存在意义是很微弱的.
因为在这种情况下,都可以规约回两两交易的对等交换情况下.
这种情况下的货币不过是一种公共计价方式.
但公允么?
考虑物品X从A到B到C的一个交易链条.
以物物交换的角度看,不过是X的所有权由A->C的一个转换过程.
考虑.
A->B的交换是B以一个溢价Y得到的.
即在A->B的实际交易价格是X+Y.
B->C的交换是C以一个溢价Z得到的.
即在B->C的实际交易价格是X+Z.
那么考虑,X+Y = X+Z
->
Y = Z么.
不一定.
因为B C对溢的private valuation并不总是相同.
也就是说,如果把货币考虑为这些信用交换过程中的一个计量单位的话.
可能并不具有任何现实意义.
因为价值估计是一个个体差异相当大的东西.
也就是说,这种计量并不具有公允性.
也就是说,存在C直接跟A交换X的话,付出的要比通过B交换来得少或者多.
这个会有什么问题呢?
只要交易始终是你情我愿的,那么这种计量浮动/偏差有什么影响呢?
考虑公允价值的市场性质.
公允价值或者说具体价值是作为一个某种特定商品交换的计价的一个体现.
简单说,就是一种类似的平均价格的存在.
它的作用是为同类交易做一种计量锚定作用.
约束同类交易尽可能地在同水平附近浮动.
在纯信用记账的范畴内,这个问题在于平均水平是受制于具体的交易的.
也就是说,这个平均价格是以某个时期内的实际发生的交易作为一个参照系得出的.
一个直观的例子就是股票市场的交易价格的形成.
里面价格的波动除了受买卖双方的预期影响之外,更多的是由实际的买卖行为决定的.
一个极端的例子就是,即便说都预期某个股票的价值应该低于某一点的话.
但只要有足够的买入流动性,也依然能够推高价格.
所以,如果以信贷作为货币理解的基础的话,那么流动性是一个隐含的必要因素.
另外一个极端的例子就是,当市场上某种产品只有一次交易成立的话.
那么其价格就有可能被认为是一种公允/平均价格.
这点是跟传统的一般等价物概念有很大区别的.
某种程度上来说,货币在这里不过是一个复杂的记账传递网络里的一个数值化体现.
它并不需要一定是对等的,或者说反映供需关系.
本质上来说,有点类似于一个单向的拟合预测函数.
基于过去的数据给出当前的一个估计.
至于是否符合实际的曲线,那就是另外一回事了.
然后基于这个思路考虑一下信贷扩张问题.
或者更确切地说固定资产或者说房地产的问题.
一个成交就意味着对市场公允价格的一次加权调整.
以资产证券或者数值化的角度看的化,随之而来的就是同等/同类资产所有者的一次重新计量过程.
也就是说,但一个200w的房子以300w的价格成交的时候,拥有同等同类房子的人资产就增加的100w.
换算成百分比的化就是50%.
那么,以记账方式考虑的话,全社会的货币就相应地在账目上增加了50%.
具体的实现方式可能是抵押/在抵押贷款等,创造出新的货币账目.
当然,实际是并不是所有的增加账目都会马上变现进入流动.
但从纯账目上来说,以公允价值计量的话,就是相当于再发行了50%的货币.
而也正因为并不是所有的新发行都会马上变成现金流进入传统意义的流通领域,所以才没有通胀的事实感觉.
某种形式的滞后效应.
考虑变现的一部分.
如果把没有进入流通的"增发"考虑为实际的增发的话,即假设只有N%的进行了变现.
那么流通领域就增加了这N%的现金.
对于这部分人来说,就是实现了固定资产向现金资产的一个转换.
假设市场永远是滞后的或者说变现的永远是少数一部分人.
那么这部分人相当于在不断的自行发新钞.
因为实际上的效果就相当于把账目推入流动领域.
那么,能无限的增发下去么?
实际上的货币供应量还是受制于对应的货币政策的.
也就是说,这里存在一个转移的上限.
因为上面的增发游戏本质上是对现有资产负债表做的一种定向腾挪.
由买房者向房产所有者做的一个现金和固定资产的交换.
一个极端的结果就是代表流动性的现金资产集中在一部分人手里.
而另一部分人持有的是等额的低流动性资产.
也就是一种事实上的一部分人有资产而无现金.
于是,考虑经济发展的信贷扩张理论.
它要求的是通过提高负债率,提高消费周转的效率,进而带动经济链条的发展.
然而上面的无流动资产的情况则是,扩张信贷的对无现金人群并无任何实际刺激.
而对于现金持有者来说,边际效用是递减的.
因此这种情况下的一个必然现象就是扩张的疲惫或者说所谓的滞涨.
即无论如何宽松,也没办法再对经济周转效率产生积极的影响.
而由于缺乏现金,各个资产层级之间理论上就存在一个"增发"能力的上限.
也就是说,由于资产数量的差异,和现金的缺乏,使得到了阶层内的一定位置之后.
拥有的现金不在具有往上一层级靠拢的趋势.
或者说,存在一个"增发"能力的效率/增长率差异带来的曲线上的分段函数表征.
即所谓的阶级固化.
这会有什么问题么?
由于存在现金流动资产的层级隔离,而由于没个层级内的现金资产的边际效用是递减的.
那么理论上就存在一个分布使得每个层级的天花板层级对"增发"的追逐动机依次下降.
这样的话,动态地考虑,层级内和层级间从长期来看是不太可能有一个稳态的.
所谓的经济周期变动.
回过头来.
这里问题的本质是信用机制下面,货币记账的不对等性造成的.
即脱离了一般等价物锚定的货币,更多的是受到各个零碎交易结果影响的.
而且由于交易的不对称性和人的决策最优解定义的差异性,整个动态系统基本上是很难可控可预测的.
所有,某种程度上来说.
求解于计划经济的某些思路,也不是一件离谱的事情.
2017-07-01
自私倾向
前两天看到的一个现象.
对于这样一张损益表:
+---------------+---------------+---------------+
| choice | red | black |
+---------------+---------------+---------------+
| 6 red 0 black | +64 | 0 |
+---------------+---------------+---------------+
| 5 red 1 black | -4 | +64 |
+---------------+---------------+---------------+
| 4 red 2 black | -8 | +32 |
+---------------+---------------+---------------+
| 3 red 3 black | -16 | +16 |
+---------------+---------------+---------------+
| 2 red 4 black | -32 | +8 |
+---------------+---------------+---------------+
| 1 red 5 black | -64 | +4 |
+---------------+---------------+---------------+
| 0 red 6 black | 0 | -64 |
+---------------+---------------+---------------+
给定6人决策,red/black分别为对于决策的reward.
比如5人选择red,1人选择black的话.
结果就是选择red的分别得到-4的reward,black的得到+64的reward.
对应的最终winning是maximize reward并且有reward >= 0的约束.
这个本来觉得应该是没有什么悬念的.
选择black是相对唯一的理性选择.
因为选择red的话,最好的结果也只是最后equally rewarded,没有一个winning存在.
而对应的,这个是选择black的最差结果.
尤其如果以等概率考察等话,black的 strategy期望正的.
即使考虑到有概率偏差.
Earning = W_1*64 + W_2*32 ....
->
Earning = W_positive*Positive_constant + W_negative*(-64)
->
Earning_black = W_positive*Positive_constant + W_negative*(-64)
Earning_red = W_positive*(-Positive_constant) + W_negative*(64)
要使得red dominate black的话,就需要
Earning_red > Earning_black
-> W_positive*(-Positive_constant) + W_negative*(64) > W_positive*Positive_constant + W_negative*(-64)
-> W_positive*(-Positive_constant) + W_negative*(64) > 0
-> Earning_red > 0
这就是只有cooperate的时候才优于black,但此时并不存在满足winning情况(ordered reward)的可能.
所以,这个直觉上来说应该是没有人会选择red的.
但实际看到的结果是首轮甚至第二轮都是全员选择red的情况.
这个就有意思了.
补充一点就是,这里其实还有个隐藏要素.
就是,在某几轮的reward会有penalty/amplify.
但这个对于基本的逻辑不会有什么实质影响.
这里大概问了下对应人员的思考思路.
一个点就是这里的strategy的focus点在于先保障最终reward>0这点.
也就是在给定的有限轮博弈中,先试图保障一个比较安全的正向收益,然后在择机削减对手.
所以这个思路实际上是 对winning条件加了一个新的约束.
至少让social reward>0.
这点在后面的培训鸡汤解释中反馈除了这歌隐含假设.
这样的话,对应的social损益表就变为:
+---------------+---------------+
| choice | social reward |
+---------------+---------------+
| 6 red 0 black | +384 |
+---------------+---------------+
| 5 red 1 black | +44 |
+---------------+---------------+
| 4 red 2 black | +32 |
+---------------+---------------+
| 3 red 3 black | 0 |
+---------------+---------------+
| 2 red 4 black | -32 |
+---------------+---------------+
| 1 red 5 black | -44 |
+---------------+---------------+
| 0 red 6 black | -384 |
+---------------+---------------+
单纯看这个的话,选择red的gradient是偏向对于reward positive的.
也就是单纯只看social optimal的话,选择red应该是属于dominated的decision.
考虑复合情况.
选择红的动机在于用personal winning去tradeoff social optimal.
放一起就是
+---------------+---------------+---------------+---------------+
| choice | social reward | trade off + effective |
+---------------+---------------+---------------+---------------+
| 6 red 0 black | +384 | +64 + +448 |
+---------------+---------------+---------------+---------------+
| 5 red 1 black | +44 | -4 | +40 |
+---------------+---------------+---------------+---------------+
| 4 red 2 black | +32 | -8 | +24 |
+---------------+---------------+---------------+---------------+
| 3 red 3 black | 0 | -16 | -16 |
+---------------+---------------+---------------+---------------+
| 2 red 4 black | -32 | -32 | -64 |
+---------------+---------------+---------------+---------------+
| 1 red 5 black | -44 | -64 | -108 |
+---------------+---------------+---------------+---------------+
| 0 red 6 black | -384 | 0 | -384 |
+---------------+---------------+---------------+---------------+
这样的话,对于某一轮来说的game setting情况就是.
一个共同的social reward值,和一个差异化的 personal reward分布P.
对于一个分布P靠后的参与者来说,是没有修复social reward的动机的.
因为让social reward>0并不会对winning有任何帮助.
而同时,由于选择red的gradian是趋向于正的.
因此,这时候依然会是选择black成为一种dominated的strategy.
这样的话,动态地考虑,只要出现了一个暂时的winer的话,其他人就会迅速地切换到black strategy.
而在没有winner的时候,black strategy本身就是一个dominated的情况.
因此,即便是加入了这个social constrain,最终的趋势也依然是负收益.
也就是说,即使是加入了这个约束,理性情况下,也不会有人选择red strategy.
但事实就是出现了不但存在并且是全员red的情况.
即便是考虑到有轮数限制,但从上面的策略上来说,也依然不存在选择red的情况.
所以这大概就是为什么人类社会比较复杂难以描述的原因.
而且考虑到即便都是理性的,由于各自的模型和隐含约束不一定一致,也可能导致结果的不确定性和偏差.
于是,从这个角度上来说,social optimal本身就算是一个伪命题.
形式上来说,是不太存在可解性的.
对于这样一张损益表:
+---------------+---------------+---------------+
| choice | red | black |
+---------------+---------------+---------------+
| 6 red 0 black | +64 | 0 |
+---------------+---------------+---------------+
| 5 red 1 black | -4 | +64 |
+---------------+---------------+---------------+
| 4 red 2 black | -8 | +32 |
+---------------+---------------+---------------+
| 3 red 3 black | -16 | +16 |
+---------------+---------------+---------------+
| 2 red 4 black | -32 | +8 |
+---------------+---------------+---------------+
| 1 red 5 black | -64 | +4 |
+---------------+---------------+---------------+
| 0 red 6 black | 0 | -64 |
+---------------+---------------+---------------+
给定6人决策,red/black分别为对于决策的reward.
比如5人选择red,1人选择black的话.
结果就是选择red的分别得到-4的reward,black的得到+64的reward.
对应的最终winning是maximize reward并且有reward >= 0的约束.
这个本来觉得应该是没有什么悬念的.
选择black是相对唯一的理性选择.
因为选择red的话,最好的结果也只是最后equally rewarded,没有一个winning存在.
而对应的,这个是选择black的最差结果.
尤其如果以等概率考察等话,black的 strategy期望正的.
即使考虑到有概率偏差.
Earning = W_1*64 + W_2*32 ....
->
Earning = W_positive*Positive_constant + W_negative*(-64)
->
Earning_black = W_positive*Positive_constant + W_negative*(-64)
Earning_red = W_positive*(-Positive_constant) + W_negative*(64)
要使得red dominate black的话,就需要
Earning_red > Earning_black
-> W_positive*(-Positive_constant) + W_negative*(64) > W_positive*Positive_constant + W_negative*(-64)
-> W_positive*(-Positive_constant) + W_negative*(64) > 0
-> Earning_red > 0
这就是只有cooperate的时候才优于black,但此时并不存在满足winning情况(ordered reward)的可能.
所以,这个直觉上来说应该是没有人会选择red的.
但实际看到的结果是首轮甚至第二轮都是全员选择red的情况.
这个就有意思了.
补充一点就是,这里其实还有个隐藏要素.
就是,在某几轮的reward会有penalty/amplify.
但这个对于基本的逻辑不会有什么实质影响.
这里大概问了下对应人员的思考思路.
一个点就是这里的strategy的focus点在于先保障最终reward>0这点.
也就是在给定的有限轮博弈中,先试图保障一个比较安全的正向收益,然后在择机削减对手.
所以这个思路实际上是 对winning条件加了一个新的约束.
至少让social reward>0.
这点在后面的培训鸡汤解释中反馈除了这歌隐含假设.
这样的话,对应的social损益表就变为:
+---------------+---------------+
| choice | social reward |
+---------------+---------------+
| 6 red 0 black | +384 |
+---------------+---------------+
| 5 red 1 black | +44 |
+---------------+---------------+
| 4 red 2 black | +32 |
+---------------+---------------+
| 3 red 3 black | 0 |
+---------------+---------------+
| 2 red 4 black | -32 |
+---------------+---------------+
| 1 red 5 black | -44 |
+---------------+---------------+
| 0 red 6 black | -384 |
+---------------+---------------+
单纯看这个的话,选择red的gradient是偏向对于reward positive的.
也就是单纯只看social optimal的话,选择red应该是属于dominated的decision.
考虑复合情况.
选择红的动机在于用personal winning去tradeoff social optimal.
放一起就是
+---------------+---------------+---------------+---------------+
| choice | social reward | trade off + effective |
+---------------+---------------+---------------+---------------+
| 6 red 0 black | +384 | +64 + +448 |
+---------------+---------------+---------------+---------------+
| 5 red 1 black | +44 | -4 | +40 |
+---------------+---------------+---------------+---------------+
| 4 red 2 black | +32 | -8 | +24 |
+---------------+---------------+---------------+---------------+
| 3 red 3 black | 0 | -16 | -16 |
+---------------+---------------+---------------+---------------+
| 2 red 4 black | -32 | -32 | -64 |
+---------------+---------------+---------------+---------------+
| 1 red 5 black | -44 | -64 | -108 |
+---------------+---------------+---------------+---------------+
| 0 red 6 black | -384 | 0 | -384 |
+---------------+---------------+---------------+---------------+
这样的话,对于某一轮来说的game setting情况就是.
一个共同的social reward值,和一个差异化的 personal reward分布P.
对于一个分布P靠后的参与者来说,是没有修复social reward的动机的.
因为让social reward>0并不会对winning有任何帮助.
而同时,由于选择red的gradian是趋向于正的.
因此,这时候依然会是选择black成为一种dominated的strategy.
这样的话,动态地考虑,只要出现了一个暂时的winer的话,其他人就会迅速地切换到black strategy.
而在没有winner的时候,black strategy本身就是一个dominated的情况.
因此,即便是加入了这个social constrain,最终的趋势也依然是负收益.
也就是说,即使是加入了这个约束,理性情况下,也不会有人选择red strategy.
但事实就是出现了不但存在并且是全员red的情况.
即便是考虑到有轮数限制,但从上面的策略上来说,也依然不存在选择red的情况.
所以这大概就是为什么人类社会比较复杂难以描述的原因.
而且考虑到即便都是理性的,由于各自的模型和隐含约束不一定一致,也可能导致结果的不确定性和偏差.
于是,从这个角度上来说,social optimal本身就算是一个伪命题.
形式上来说,是不太存在可解性的.
2017-06-11
纪念碑谷的一点感想
最近在路上补了下纪念碑谷.
总游戏时长可能也就五六个小时吧.
感觉与其说是一款解谜游戏,不如说是某种形式的故事本.
因为严格来说,它讲究的并不是实际的解谜方式.
就大多数关卡场景来说,每个机关设计小段落还是比较明显的.
每个阶段基本就是一个唯一解的机关触发,并不存在一个比较复杂的搜索路径.
如果是作为一个解谜游戏来说,要点设计未免过于单纯.
那么它让人觉得好或者说眼前一亮的点在于什么呢.
也还是机关的设计.
只不过立足点不是复杂性和组合度.
而是一种小心思的共鸣或者说分享感.
每一个机关的触发更像是帮着拆解和介绍眼前的这个盒子的小趣味.
可能也并不是就是要讲述一个什么故事.
而是拿着小孩子分享自己的想象中的好玩的小玩意的感觉.
机关点的设计反而是一种把这种心思和切面连贯起来的东西.
去掉的话可能也并不影响感受.
因为享受的可能就是那种作者某种形式的娓娓道来的结构解说.
所以某种程度上来说它更像是某种形式的作品欣赏.
像看一幅画或者一个故事.
你享受的是作者想要表达的内容或者某个瞬间和场景.
比如某些对星夜之类的绘画光影的动画视觉化表演那样.
通过某种手段把作者的创造思路以及对某种表现形式的不同寻常的表述方式.
把光影的流动动态感静态化的手段.
也就是作者对动的某些特征的感受的本质感受还原具象化的一个过程.
就像某几个关卡对空间组合的方式一样.
在看的是另外一个侧面是什么,不同侧面又是怎么构造连接在一个整体上的.
它不见得有多精妙.
但是就是有一个人在很得意很自信也很不卑不亢地给你介绍他认为的有趣的东西.
某种有点微妙的交流方式.
只不过用的是光影错位,盒子结构,空间立体感等这些元素.
表达的不是什么特定的意思或者目的.
而要的是对这些元素的某种会意的笑.
所以顺着这个思路模仿的话,大概就是找某些自己觉得有趣的点然后通过安插一些机关导引,把这种你觉得有趣的地方展示出来.
就像如果想要展示韵律的某种微妙和谐感的话,可能是构造一系列短小的机关,完成一段段的小和弦,然后最后组合起来.
又或者像剪纸,以路线的方式渐次展开折叠然后完整图的方式.
或者水流之类的方式,以流速转折等表现书法之类的横折点钩的趋势意蕴.
或者水彩之类的一些技法的巨象化表达.
本质上来说,就像是一种各自技法和手法的科普介绍.
只不过是以机关设置的方式作为节奏控制而已.
所以你很难说这是一款游戏.
也很难说它是不是好玩.
甚至于说谈不谈地上解谜/游戏性.
如果不是作为一个现象出现的话,也很难说会怎么样.
或者说跟它思路类似的东西可能并不少.
但只有它成为一个现象.
也很难说,即使是它也可能并不能持续太久地流行.
不是说不够好而是可能没有带来新的感受点.
就像你知道它会给你带来什么感受,有什么预期.
甚至于你知道它会给你一些有趣点的讲解和带来一些愉悦性.
但可能也不会刻意地花时间去实际感受.
因为有预期.
所以很难超出预期给人一种耳目一新的感觉.
反过来说,他之所以有话题性,可能只是恰好让人知道了另外一种新的思路去设计和构造/ 表达某些东西.
而一旦这种方式被人所了解了之后,剩下的可能就没什么特别了.
总游戏时长可能也就五六个小时吧.
感觉与其说是一款解谜游戏,不如说是某种形式的故事本.
因为严格来说,它讲究的并不是实际的解谜方式.
就大多数关卡场景来说,每个机关设计小段落还是比较明显的.
每个阶段基本就是一个唯一解的机关触发,并不存在一个比较复杂的搜索路径.
如果是作为一个解谜游戏来说,要点设计未免过于单纯.
那么它让人觉得好或者说眼前一亮的点在于什么呢.
也还是机关的设计.
只不过立足点不是复杂性和组合度.
而是一种小心思的共鸣或者说分享感.
每一个机关的触发更像是帮着拆解和介绍眼前的这个盒子的小趣味.
可能也并不是就是要讲述一个什么故事.
而是拿着小孩子分享自己的想象中的好玩的小玩意的感觉.
机关点的设计反而是一种把这种心思和切面连贯起来的东西.
去掉的话可能也并不影响感受.
因为享受的可能就是那种作者某种形式的娓娓道来的结构解说.
所以某种程度上来说它更像是某种形式的作品欣赏.
像看一幅画或者一个故事.
你享受的是作者想要表达的内容或者某个瞬间和场景.
比如某些对星夜之类的绘画光影的动画视觉化表演那样.
通过某种手段把作者的创造思路以及对某种表现形式的不同寻常的表述方式.
把光影的流动动态感静态化的手段.
也就是作者对动的某些特征的感受的本质感受还原具象化的一个过程.
就像某几个关卡对空间组合的方式一样.
在看的是另外一个侧面是什么,不同侧面又是怎么构造连接在一个整体上的.
它不见得有多精妙.
但是就是有一个人在很得意很自信也很不卑不亢地给你介绍他认为的有趣的东西.
某种有点微妙的交流方式.
只不过用的是光影错位,盒子结构,空间立体感等这些元素.
表达的不是什么特定的意思或者目的.
而要的是对这些元素的某种会意的笑.
所以顺着这个思路模仿的话,大概就是找某些自己觉得有趣的点然后通过安插一些机关导引,把这种你觉得有趣的地方展示出来.
就像如果想要展示韵律的某种微妙和谐感的话,可能是构造一系列短小的机关,完成一段段的小和弦,然后最后组合起来.
又或者像剪纸,以路线的方式渐次展开折叠然后完整图的方式.
或者水流之类的方式,以流速转折等表现书法之类的横折点钩的趋势意蕴.
或者水彩之类的一些技法的巨象化表达.
本质上来说,就像是一种各自技法和手法的科普介绍.
只不过是以机关设置的方式作为节奏控制而已.
所以你很难说这是一款游戏.
也很难说它是不是好玩.
甚至于说谈不谈地上解谜/游戏性.
如果不是作为一个现象出现的话,也很难说会怎么样.
或者说跟它思路类似的东西可能并不少.
但只有它成为一个现象.
也很难说,即使是它也可能并不能持续太久地流行.
不是说不够好而是可能没有带来新的感受点.
就像你知道它会给你带来什么感受,有什么预期.
甚至于你知道它会给你一些有趣点的讲解和带来一些愉悦性.
但可能也不会刻意地花时间去实际感受.
因为有预期.
所以很难超出预期给人一种耳目一新的感觉.
反过来说,他之所以有话题性,可能只是恰好让人知道了另外一种新的思路去设计和构造/ 表达某些东西.
而一旦这种方式被人所了解了之后,剩下的可能就没什么特别了.
2017-06-05
由长尾展开
重新考虑下长尾.
通常关注的是基数.
因为隐含的假设是单位价值细微.
比如千次几毛的PV价值.
但换个角度,实际上考量的还是如何提高总量收益.
千次PV几毛跟单品交易几百的区别大概是7~8个零的数量级差异.
换算回来的话就是同等的交易单元/用户数.
这里基于的是个体贡献的价值或者说付费意愿和能力约等于零.
那么考虑,如果付费能力提高几个数量级的话,相应的需求用户基数就没那么大.
就PV而言,从千次几毛到每次几块,那么这里就是5个零的数量级.
对应的需求PV/付费用户就可以从千万到百的级别.
这个是什么呢.
比如某B站的新番承包机制.
或者有如现在喜欢谈的订阅或者说打赏.
又比如早已在网游中成熟下来的免费模式的VIP制度.
这里的一个动机可以理解为对某个概率分布区间的用户价值的一个提升作用.
一个直白的理解就是,原来没千次的PV贡献价值之所以低是因为并没有给出更高的用户价值投入方式.
所以这个思路推广一下的话,就是对给定各种区间/阶级用户的一个成本投入提升.
某种程度上来说,就是一种价格歧视的重新应用.
所不同的是,价格歧视基于的是一种信息不对称关系.
而在这种长尾总量提升的情况下,可能更多的反而是来自于信息透明或者共享.
就像B站赞助和打赏赞赏等,可能有相当一部分动机是在于付费是为了服务的持续性考虑.
即使这种长久运营需求并不是一种必需的契约关系,而完全是自愿的行为.
所以,这里可能是某种所谓定价权的反转变化的思路.
即价格由卖方提供转变为买方根据个体价值体系做定夺.
也就是老话题,private valuation.
综合一下的话,就是
value = w_1*seller_side_valuation + w_2*buyer_side_valuation.
传统的讨价还价就是sv(seller_side_valuation)和bv(buyer side valuation) 就趋近于市场价格,也就是w_1和w_2接近1/2的情况.
一般长尾则是w_1放大,而w_2为零.而sv和bv为何并不太有定性意义.
而买方反转定价的情况就是w_2为1的情况.
也就是在一般长尾的基础上兑现了溢价买方的价值.
那么,存不存在或者说w_2跟w_1类似放大的情况呢.
大概就是把bv做阶级拆分的\sum_i w_2_i*bv_i的形式了.
于是类似的,把价格歧视考虑进来就有
value = \sum_j w_1_j*sv_j + \sum_j \sum_i w^j_2_i*bv_i
简单化描述就是
value = w_1*sv + \sum_i w_2_i*bv_i.
这里跟讨价还价的区别在于,前者针对的是有公允价值或者说容易有相当客观定价的情况.
而svbv针对的则是一种没有客观定价,或者说客观定价没有意义的情况.
考虑下最大化的问题.
像赞助形式,如果sv提高到一定程度,那么就有可能bv 全为零.
一个例子就是会员限定的制度.
所以这里的bv_i应该是sv 相关的一个函数.
从图形上来说,\sum_i w_2_i*bv_i应该是一个类似于以sv 为横坐标,人数为纵坐标的密度曲线.
借鉴供需/边际曲线的思路的话,就存在一个均衡点时的左侧过零点的sv曲线,与bv曲线交点所构成的面积最大.
从拟合的角度来说,其实就是i+1维的linear equation.
只不过实际情况是bv_i 也是未知的.
或者简单点把w抹去.
value = sv + \sum_i bv_i + adjusted.
通常关注的是基数.
因为隐含的假设是单位价值细微.
比如千次几毛的PV价值.
但换个角度,实际上考量的还是如何提高总量收益.
千次PV几毛跟单品交易几百的区别大概是7~8个零的数量级差异.
换算回来的话就是同等的交易单元/用户数.
这里基于的是个体贡献的价值或者说付费意愿和能力约等于零.
那么考虑,如果付费能力提高几个数量级的话,相应的需求用户基数就没那么大.
就PV而言,从千次几毛到每次几块,那么这里就是5个零的数量级.
对应的需求PV/付费用户就可以从千万到百的级别.
这个是什么呢.
比如某B站的新番承包机制.
或者有如现在喜欢谈的订阅或者说打赏.
又比如早已在网游中成熟下来的免费模式的VIP制度.
这里的一个动机可以理解为对某个概率分布区间的用户价值的一个提升作用.
一个直白的理解就是,原来没千次的PV贡献价值之所以低是因为并没有给出更高的用户价值投入方式.
所以这个思路推广一下的话,就是对给定各种区间/阶级用户的一个成本投入提升.
某种程度上来说,就是一种价格歧视的重新应用.
所不同的是,价格歧视基于的是一种信息不对称关系.
而在这种长尾总量提升的情况下,可能更多的反而是来自于信息透明或者共享.
就像B站赞助和打赏赞赏等,可能有相当一部分动机是在于付费是为了服务的持续性考虑.
即使这种长久运营需求并不是一种必需的契约关系,而完全是自愿的行为.
所以,这里可能是某种所谓定价权的反转变化的思路.
即价格由卖方提供转变为买方根据个体价值体系做定夺.
也就是老话题,private valuation.
综合一下的话,就是
value = w_1*seller_side_valuation + w_2*buyer_side_valuation.
传统的讨价还价就是sv(seller_side_valuation)和bv(buyer side valuation) 就趋近于市场价格,也就是w_1和w_2接近1/2的情况.
一般长尾则是w_1放大,而w_2为零.而sv和bv为何并不太有定性意义.
而买方反转定价的情况就是w_2为1的情况.
也就是在一般长尾的基础上兑现了溢价买方的价值.
那么,存不存在或者说w_2跟w_1类似放大的情况呢.
大概就是把bv做阶级拆分的\sum_i w_2_i*bv_i的形式了.
于是类似的,把价格歧视考虑进来就有
value = \sum_j w_1_j*sv_j + \sum_j \sum_i w^j_2_i*bv_i
简单化描述就是
value = w_1*sv + \sum_i w_2_i*bv_i.
这里跟讨价还价的区别在于,前者针对的是有公允价值或者说容易有相当客观定价的情况.
而svbv针对的则是一种没有客观定价,或者说客观定价没有意义的情况.
考虑下最大化的问题.
像赞助形式,如果sv提高到一定程度,那么就有可能bv 全为零.
一个例子就是会员限定的制度.
所以这里的bv_i应该是sv 相关的一个函数.
从图形上来说,\sum_i w_2_i*bv_i应该是一个类似于以sv 为横坐标,人数为纵坐标的密度曲线.
借鉴供需/边际曲线的思路的话,就存在一个均衡点时的左侧过零点的sv曲线,与bv曲线交点所构成的面积最大.
从拟合的角度来说,其实就是i+1维的linear equation.
只不过实际情况是bv_i 也是未知的.
或者简单点把w抹去.
value = sv + \sum_i bv_i + adjusted.
2017-05-13
关于word2vec的一点想法
考虑word to vector的intuition.
给定两个词,如果存在某种意义的相似性的话.
那么,这两个词对应的vector representation就具有某种意义上的近似.
tensorflow里给的example实现对这个近似的定义是cosin值.
直觉上来说,就是给定两个向量在某些维度的方向指向上有着某种趋同性.
从embedding的角度来说,假设对一组词有着某种未知的词性/词义等的归类方式的话.
这种cosin趋向性实际上就是指向的这个embedding的某些维度了.
考虑如果用L2 distance来定义similarity.
那么它表示的则是这些词对应的点具有一些cluster性质.
而这些性质有什么含义,则是相对拟合过程所用的loss function的意义有关的.
因为从结果上来说,它对应的是embedding的各个维度之间都要求只有细微的差别.
如果出来的结果对应的vector不是一个稀疏表示的话,可能并不能收敛地很好.
或者说结果有意义.
所以,从这个侧面上来说,可能logistics regression比较合适.
变成类似多label的classification,从而达到类似一个binary encode的vector形式.
对应的1/0则表示相应embedding的dimension是否具有对应特征的一种标识.
这样的话,对于结果的一种可能直觉上的解释就是类似某种词性划分.
因为在这种情况下,对于不同的词可能会对于到同一个vector形式.
或者在某些维度具有重合性.
于是反观cosin形式.
cosin形式除了维度指向之外,还有另外一个信息就是长度.
直觉上来说,类似长度但维度指向不同的vector,实际上是处在一个hypersphere上面的.
也就是说,理论上,如果构造合适的loss function的话,是可以让最终的vector包含更多的信息的.
比如cosin similarity作为词性,长度作为词义或者对应的使用场景等.
实际上来说,这个vector对应的就是个2-D的离散feature组合了.
然后考虑loss的构造.
tensorflow的example实现使用nce loss,noise contrastive estimation.
大致就是在minimize原本的cosin的时候,加入一个negative sample项,做类似adversarial的目的.
因为如果没有这个negative的话,一个可能的最终解就是所有vector具有同样的值.
所以某种程度上来说,是一个既要overfit,又不要overfit的过程.
直觉上来说,就是把一些vector move together的时候,separate the other.
大致看了下tensorflow nce的negative sample应该用的是log uniform distribution.
按照这个概率选取一些作为penalty.
所以,理论上来说,这个adversarial项如果选取的不够好的话,结果可能也就不会很理想.
比如training set里都是些垂直领域的词,从人的角度来说都具有类型的词性词义等.
但可能adversarial的选取大概率的是这些相近的词类.
那么结果自然是一直被penalty,loss收敛不下去结果不理想不stationary.
而tensorflow的恰恰好是高词频的会更容易被作为adversarial.
所以适合的是topic/context比较多样化的场景.
这样才可能比较好地被"cluster".
还有一点就是tensforflow里word pair/skip gram model的生成方式.
predicative pair是通过一个skip window控制的.
也就是选定一个词,然后随机地从前后一定范围内选取一个词作为predicate.
这样的话,考虑长句松散语意和短句紧凑语意风格的training set的话,结果应该也是有很大不同的.
如果行文风格比较短小精悍的话,可能词组配对频率分布会比较平坦.
这样的话按照原有的loss来做的话,结果可能就不太好了.
考虑如果是强行生成所有组合.
那么这些组合实际上暗含的信息就是任意两个词之间co-occurrence的概率.
在最终的vector space里,cluster的vector之间就是彼此具有类似的context的属性.
因为两两之间在共同出现的频率差不多,也就一定程度上地说明在文本的使用场景具有某种长度的相似性.
当然,可能最终还是相当程度地会收到adversarial的选取方式的影响.
有可能避免negative这种不确定因素么?
如果对一个batch的同一个feeding sample多做几次gradient decent的话.
直觉上就是让当场的sample更靠近一下.
期望的是通过这种reinforce变相地离其他sample更远一些.
然后如果是确实高频出现的话,同样的reinforce会及时地回调.
形式上来说,就类似于做了一个基于频率的倍数放大而已.
并不一定有什么用.
考虑下entropy.
对于给定的training set来说p(x)是确定的.
对于定义
entropy = p(x) * log(1/p(x))
对于词x,以及对应的相似词y有
entropy = p(x,y) * log(1/tanh(similarly(x,y)))
通过minimize这个entropy的话,会是什么结果呢?
形式上来说,它可能等价于
entropy = W(p) * similarly(x,y)
一个跟固有概率/频率相关的相似度.
那么对于低频的pair来说,w->0,GD的过程可能改动不大.
但对于高频的pair,GD的过程就可能会做相对幅度的变动.
也就是直觉上的对于低频pair不做改动,而仅仅对高频部分做调整.
当然,实际怎么样就是另外一回事了.
给定两个词,如果存在某种意义的相似性的话.
那么,这两个词对应的vector representation就具有某种意义上的近似.
tensorflow里给的example实现对这个近似的定义是cosin值.
直觉上来说,就是给定两个向量在某些维度的方向指向上有着某种趋同性.
从embedding的角度来说,假设对一组词有着某种未知的词性/词义等的归类方式的话.
这种cosin趋向性实际上就是指向的这个embedding的某些维度了.
考虑如果用L2 distance来定义similarity.
那么它表示的则是这些词对应的点具有一些cluster性质.
而这些性质有什么含义,则是相对拟合过程所用的loss function的意义有关的.
因为从结果上来说,它对应的是embedding的各个维度之间都要求只有细微的差别.
如果出来的结果对应的vector不是一个稀疏表示的话,可能并不能收敛地很好.
或者说结果有意义.
所以,从这个侧面上来说,可能logistics regression比较合适.
变成类似多label的classification,从而达到类似一个binary encode的vector形式.
对应的1/0则表示相应embedding的dimension是否具有对应特征的一种标识.
这样的话,对于结果的一种可能直觉上的解释就是类似某种词性划分.
因为在这种情况下,对于不同的词可能会对于到同一个vector形式.
或者在某些维度具有重合性.
于是反观cosin形式.
cosin形式除了维度指向之外,还有另外一个信息就是长度.
直觉上来说,类似长度但维度指向不同的vector,实际上是处在一个hypersphere上面的.
也就是说,理论上,如果构造合适的loss function的话,是可以让最终的vector包含更多的信息的.
比如cosin similarity作为词性,长度作为词义或者对应的使用场景等.
实际上来说,这个vector对应的就是个2-D的离散feature组合了.
然后考虑loss的构造.
tensorflow的example实现使用nce loss,noise contrastive estimation.
大致就是在minimize原本的cosin的时候,加入一个negative sample项,做类似adversarial的目的.
因为如果没有这个negative的话,一个可能的最终解就是所有vector具有同样的值.
所以某种程度上来说,是一个既要overfit,又不要overfit的过程.
直觉上来说,就是把一些vector move together的时候,separate the other.
大致看了下tensorflow nce的negative sample应该用的是log uniform distribution.
按照这个概率选取一些作为penalty.
所以,理论上来说,这个adversarial项如果选取的不够好的话,结果可能也就不会很理想.
比如training set里都是些垂直领域的词,从人的角度来说都具有类型的词性词义等.
但可能adversarial的选取大概率的是这些相近的词类.
那么结果自然是一直被penalty,loss收敛不下去结果不理想不stationary.
而tensorflow的恰恰好是高词频的会更容易被作为adversarial.
所以适合的是topic/context比较多样化的场景.
这样才可能比较好地被"cluster".
还有一点就是tensforflow里word pair/skip gram model的生成方式.
predicative pair是通过一个skip window控制的.
也就是选定一个词,然后随机地从前后一定范围内选取一个词作为predicate.
这样的话,考虑长句松散语意和短句紧凑语意风格的training set的话,结果应该也是有很大不同的.
如果行文风格比较短小精悍的话,可能词组配对频率分布会比较平坦.
这样的话按照原有的loss来做的话,结果可能就不太好了.
考虑如果是强行生成所有组合.
那么这些组合实际上暗含的信息就是任意两个词之间co-occurrence的概率.
在最终的vector space里,cluster的vector之间就是彼此具有类似的context的属性.
因为两两之间在共同出现的频率差不多,也就一定程度上地说明在文本的使用场景具有某种长度的相似性.
当然,可能最终还是相当程度地会收到adversarial的选取方式的影响.
有可能避免negative这种不确定因素么?
如果对一个batch的同一个feeding sample多做几次gradient decent的话.
直觉上就是让当场的sample更靠近一下.
期望的是通过这种reinforce变相地离其他sample更远一些.
然后如果是确实高频出现的话,同样的reinforce会及时地回调.
形式上来说,就类似于做了一个基于频率的倍数放大而已.
并不一定有什么用.
考虑下entropy.
对于给定的training set来说p(x)是确定的.
对于定义
entropy = p(x) * log(1/p(x))
对于词x,以及对应的相似词y有
entropy = p(x,y) * log(1/tanh(similarly(x,y)))
通过minimize这个entropy的话,会是什么结果呢?
形式上来说,它可能等价于
entropy = W(p) * similarly(x,y)
一个跟固有概率/频率相关的相似度.
那么对于低频的pair来说,w->0,GD的过程可能改动不大.
但对于高频的pair,GD的过程就可能会做相对幅度的变动.
也就是直觉上的对于低频pair不做改动,而仅仅对高频部分做调整.
当然,实际怎么样就是另外一回事了.
2017-04-16
关于确定性
seq2seq的intuition某种程度上来说就是把两个vector拟合出一个映射关系.
或者说任何向量化的计算抽象了说都是拟合这种映射关系.
所不同的是像machine translation的recurrent neural network/long short term memory.
提供的是一种position相关的调整策略.
因为从语言侧面来说,翻译的一个思路是两种语言之间语义指向的别称之间的关联关系.
也就是所谓的基本字词的转换关系.
而语法只不过是一种arrangement的方式.
对于表意来说,怎么放置其实更多的是一种约定俗成的关系.
所以简化一下就是两种语言的意指之间的对照关系.
于是,通过LSTM等具有位置调整功能的组件把两种语言关联到一种通用的"语法"结构下面,也就很自然而然了.
RNN系某种意义上来说,对于向量本身就像一种elementary operation.
简单地对向量的唯独做类似行交换的reprojection.
它跟普通的matrix transform的思路区别在于,这种纬度切换面向的是单个的向量本身.
而不是一个操作apply到所有向量的同一纬度.
所以,这个的intuition更像是一种pattern extraction.
CNN也类似.
如果把RNN像CNN一样排练,或者把CNN的convolution layer看出某种形式长度的LSTM的话.
pooling+rectifier也就类似于某种位置转换来达到某种pattern的align.
考虑回两组向量的拟合映射问题.
或者说去掉拟合连两个字.
给定任意两组向量和之间的一个映射关系,定义这个映射关系为一个operator.
于是,一个例子,比如整数加法,或者所谓的group.
1+1 = 2 就是[1,1] -> [2]
2+3 = 5 就是[2,3] -> [5]
那么同样地,可以定义另外一种operator.
使得
1+1 = 9 也就是[1,1] -> [9]
之类的.
从group theory的角度来说,只是某些约束符合不符合/满足不满足/定义没定义的问题.
这里的一个点在于.
数学或者说某种确定性关系,某种程度上来说是对向量两边的映射关系的一个特定子集描述.
或者说是某种特定的分组方式.
于是问题就在于,对于这个特解的所谓合理/相容/不矛盾是包含了这个group的某种constrain在内的.
简单说,就是排除了"已知的反例"的.
比如对于square操作.
\sqrt 2和\sqrt -2的区别.
后者可以说是在前者的一个新的reproduction或者说一个新的group子集划分.
这里想说的是什么呢?
所谓的确定性或者说科学性合理性在于,可以给出A->B的一个自洽的结果.
也就是,这时候有一种足够描述能力的子集划分,去概括这些映射关系.
那么,当如果出现一个是地A->B不自洽了的情况.
就像out of vocabulary或者某些算法的bad case的时候,就出现的需要对这个"映射关系"/理论做修补的时候.
就像物理学的发展.
那么到底什么是确定性呢.
或者说理论上存在么.
halting problem的思路在于,如果一个UTM能够simulate自身的话.
这个simulation是non stop的递归过程.
于是反过来说不存在一个UTM可以描述所有的东西.
这里隐含的一个假设就是,如果可以simulate,那么一定是会或者说必要halt的.
反过来说,如果把这个条件去掉,那么就存在一个可以simulate除自身之外的任意事件的UTM.
也就是说,把这组映射关系里去掉某些之后还是可以自洽的.
于是,反过来说,只要出现任意一个不在自洽体系里的case的话,这个体系的确定性就不存在.
或者说至少需要重构.
因此,一个体系所能描述的"确定性"只是针对已知或者已经发生的A->B的一个特例划分.
它的有效性最多仅仅限于"过去".
而对于"未来",这个是undefined的.
或者说任何向量化的计算抽象了说都是拟合这种映射关系.
所不同的是像machine translation的recurrent neural network/long short term memory.
提供的是一种position相关的调整策略.
因为从语言侧面来说,翻译的一个思路是两种语言之间语义指向的别称之间的关联关系.
也就是所谓的基本字词的转换关系.
而语法只不过是一种arrangement的方式.
对于表意来说,怎么放置其实更多的是一种约定俗成的关系.
所以简化一下就是两种语言的意指之间的对照关系.
于是,通过LSTM等具有位置调整功能的组件把两种语言关联到一种通用的"语法"结构下面,也就很自然而然了.
RNN系某种意义上来说,对于向量本身就像一种elementary operation.
简单地对向量的唯独做类似行交换的reprojection.
它跟普通的matrix transform的思路区别在于,这种纬度切换面向的是单个的向量本身.
而不是一个操作apply到所有向量的同一纬度.
所以,这个的intuition更像是一种pattern extraction.
CNN也类似.
如果把RNN像CNN一样排练,或者把CNN的convolution layer看出某种形式长度的LSTM的话.
pooling+rectifier也就类似于某种位置转换来达到某种pattern的align.
考虑回两组向量的拟合映射问题.
或者说去掉拟合连两个字.
给定任意两组向量和之间的一个映射关系,定义这个映射关系为一个operator.
于是,一个例子,比如整数加法,或者所谓的group.
1+1 = 2 就是[1,1] -> [2]
2+3 = 5 就是[2,3] -> [5]
那么同样地,可以定义另外一种operator.
使得
1+1 = 9 也就是[1,1] -> [9]
之类的.
从group theory的角度来说,只是某些约束符合不符合/满足不满足/定义没定义的问题.
这里的一个点在于.
数学或者说某种确定性关系,某种程度上来说是对向量两边的映射关系的一个特定子集描述.
或者说是某种特定的分组方式.
于是问题就在于,对于这个特解的所谓合理/相容/不矛盾是包含了这个group的某种constrain在内的.
简单说,就是排除了"已知的反例"的.
比如对于square操作.
\sqrt 2和\sqrt -2的区别.
后者可以说是在前者的一个新的reproduction或者说一个新的group子集划分.
这里想说的是什么呢?
所谓的确定性或者说科学性合理性在于,可以给出A->B的一个自洽的结果.
也就是,这时候有一种足够描述能力的子集划分,去概括这些映射关系.
那么,当如果出现一个是地A->B不自洽了的情况.
就像out of vocabulary或者某些算法的bad case的时候,就出现的需要对这个"映射关系"/理论做修补的时候.
就像物理学的发展.
那么到底什么是确定性呢.
或者说理论上存在么.
halting problem的思路在于,如果一个UTM能够simulate自身的话.
这个simulation是non stop的递归过程.
于是反过来说不存在一个UTM可以描述所有的东西.
这里隐含的一个假设就是,如果可以simulate,那么一定是会或者说必要halt的.
反过来说,如果把这个条件去掉,那么就存在一个可以simulate除自身之外的任意事件的UTM.
也就是说,把这组映射关系里去掉某些之后还是可以自洽的.
于是,反过来说,只要出现任意一个不在自洽体系里的case的话,这个体系的确定性就不存在.
或者说至少需要重构.
因此,一个体系所能描述的"确定性"只是针对已知或者已经发生的A->B的一个特例划分.
它的有效性最多仅仅限于"过去".
而对于"未来",这个是undefined的.
订阅:
博文 (Atom)
难而正确
这两天梁文锋的四小时讲话挺火的. 大致看了下有点挺有意思的. 一个是谈到对sota模型的理解. 按照讲话时间一个月前的话,应该指的是fable/mythos的激活参数量. 大概在800B左右. 这里比较有意思的是他关注的不是总参数量,而是激活量. 换个角度来说,目前scaling...
-
从未对雪有过什么幻想. 于是,当这雪终究下下来了,也没什么特别的兴奋. 只是,由于是南方人,也就姑且好奇了一番. 望了望着属于别处的风景. 也许是因为昨晚下过雨,也或许是本来就会如此. 冰混着点积水,倒是怀念起阳光灿烂的日子了. 面对着这未知的...
-
去看了长安的荔枝. 前半段还可以,尤其像荔枝林里不知道是笑还是哭的几个镜头表演算是相当出色了. 结合人物背景的那种对目标的绝望与对当下人际环境的希望的交叉矛盾心理. 后半段就有些过滤潦草了. 如果说整片是对于一骑红尘妃子笑,无人知是荔枝来的解构的话. 带入民生潦倒涂炭这点是没问题...
-
看完了一部未完成的电影. 这部片片子比较有意思的是一开始那段自嘲. 秦昊关于既然拍了也播不了,只是私下小圈子里自嗨的事情又什么意义的质问. 片里导演也 讪讪地承认生活的现实. 到这里其实沿着原有的思路,把补拍和一些意外穿插进去,可能还是一个不错的文艺片. 至少于戏里戏外的导演来说...