xyz 在小组 2049BBS
动态 帖子 4 评论 184 短评 0 收到的赞 送出的赞
  1. xyz   在小组 2049BBS 回复文章

    用非對稱加密和閱後即焚在公共論壇安全的私聊

    嗯,是只要贴出自己的public key还是需要public和private的都要贴?

    先贴一个好了...

    public key:

    MIICIjANBgkqhkiG9w0BAQEFAAOCAg8AMIICCgKCAgEAganb7z5JAUnOwct8SEVYEnKdRuDDkGIyC6dbAGdSpkHtP+sOFyI+vUGC8ONdWWlZ0DVcuedHsRWlgWcf9vplRZZwt2PTxQHIHrXEy8CY4uOvrQRpu4ygBqL1CAODjOhYZsD/DtqKOYpvJ90FwhCwLA3a/bUB87XA5pi6nsVU0vz75bEW1/O/nRT4bgrSPyvhl1+ng2TfqHcnKCSixwkh3R0U+1f6PmvLYnv2CT8EaVKzUltM8Z65SZEW1i41YABdUCdTgd7ju8M3PGamxe+9VYQLXdQI+HSf+9EPDLflHjPF+RaT0sl0e3jrzoPkiiXPm2R3MwvEFxYwhIoaW6lEt7Ul2pzG8J9aBR++Ga932CefK203mzA3iPFiaSHvsoraeB7WdXIGkguLTUwKU7JR2Gcv8Z7JAxccKGiv8z0eE38iqxelR8VWjjQOVZU+eg49XbzE4LqATHUWRdilA7aj7zTZ/Kt5gvJIU7FvgOslsTWZCOe7/FGDQ5onEDglYIV6+Pa4KUoYyJnuITw++qMC9Xz5S6PdtThmYpxaJ3YQZ0QjDahKI7PWbdWIQfMhmIDxudT0LGypVhuD9AT4qAOkErtuzB9fqOTT99oONE6wHWblpZJMZ7PNi/77apO+bSoLg12+7MP9BtEdNdCqgASp09433e/rM2eWM1KZmN3mclUCAwEAAQ==

  2. xyz   在小组 2049BBS 回复文章

    Google使用算法技术以外的手段人工干预排序。

    @懦夫斯基 #21

    的确很像... 这种生理和心理的摧残的确很让人痛苦,还是希望早点实现完全用AI来filter暴力和血腥的内容,人看久了真的会出问题的...

  3. xyz   在小组 2049BBS 回复文章

    用非對稱加密和閱後即焚在公共論壇安全的私聊

    呃,有点意思...

    我这个电脑小白试试看用你的public key加密

    bUOI33DFCG/9Vbbu8hf4AkcFIiWes6YLwKFxnp6Axhks3XeenivzECvqt8TmNAXQEuP7zVY/gKZOExaYKzyNvoc59Scm20IbJl9qftWjeBiytgfTUR3dp1qSwIf1tLJdA/NOVibOX34dYayDC6UoVPil2FO/7g8lmGATU9vzMdqI8QUltuiswyo/qET/8e7ARWxyQCYrDdCwqwZ2WBEN2ThrcXQ9at0j8/BwXi53N/pB3G5s5dSoqJ0Hs0jLNXfhAiF+8sHDIYB4Rb5ZMpoo3H2a9rWSzTauRDc+ATBZN0HgdgcvSVt1PhhzCT0qm6b7HAPEJKG6+6ANvMrqjZ1R+FlVmOnGUokdWXkuYacQk1veO4cgRDxkp1Od+NEshCCYyNC2xiUmL6ln+6vgbNOr0xeJLBpY40cdUAbSy+AyxgdDhXsS5MLxOLNdJ6q2RDUrztO35Lwtmjnq5hhjSBFqjB0fUM6B67aa8/ywc9/FwBBHw9KjVE/birwLj0SCLH/Q7vX/9wFUIXG2BI+plC7H/9Xt6lpq7+FqkyEX2ZPMptFYmXraf83DeTaSnN2miDpgBjKw9d5yDjCku0W7ZXMCIU9ZI0bPrpQIFAcLVsTuS9JCNWl2toXm5U2t5aLNNha40/0Dd/odx3GgjP4CmdQoVHIIaHGcMxKHpY74/rqAWlA=

  4. xyz   在小组 2049BBS 回复文章

    请问手机上有哪些安全好用的输入法?

    @无名 #7 @Merlin #6

    好的好的,多谢多谢,那我就放心了...

    其实我从来不知道手机上除了默认的输入方式还有其他的选择...

  5. xyz   在小组 2049BBS 回复文章

    <应用户要求管理员清空内容22>

    看来2049真有必要开一个交友版了... 鸟鸟也陷进去了...

  6. xyz   在小组 2049BBS 回复文章

    请问手机上有哪些安全好用的输入法?

    Android或者iPhone默认的输入法安全吗?

  7. xyz   在小组 2049BBS 回复文章

    ~全文~《当谷歌遭遇维基解密:阿桑奇与施密特对话录》

    @magnus #15

    嗯嗯,好的,我先去试试Assange的Cypherpunks。然后再试试Permanent Record。多谢:)

  8. xyz   在小组 2049BBS 回复文章

    百度、科大讯飞参与,接入支付宝、微信——中国天网工程

    @sorrysorrysorry 你看,你看,好像证实了你和我说的"内容现实里已经在运行"了呃。看来避免数据整合,降低预测的精度的考虑需要提上日程了...

  9. xyz   在小组 2049BBS 回复文章

    天猫双11数据是假的吗?

    @小二 #23

    那啥,为了回这个帖子,让我推迟了半小时吃饭... 如果你真的认识我,下次卖几个猫山王带给我,存货都快吃完了...

    匿了...

  10. xyz   在小组 2049BBS 回复文章

    Google使用算法技术以外的手段人工干预排序。

    @勃列日涅夫 #19

    呃,读了一下,这些审核员也很辛苦啊... 熬大夜,而且没有技术含量,学不到东西。

    让我想起了以前看过的一个关于youtube外包censorship 的report,现在找不到了,也是这种labor intensive的工作... 但是这种工作是那些审核员所能找到的最好的工作了,当youtube慢慢转向AI以后这些工作慢慢地也会消失... 听上去很悲伤很无赖的感觉...

    唉,好像只要是有supervised 的learning,好像supervisor的偏见都是不可避免的。希望以后多搞点unsupervised learning吧... 或者supervisor只判断事实(比如这张图片是否露点),而不判断价值(这张图片是否是色情)也可以...

  11. xyz   在小组 2049BBS 回复文章

    天猫双11数据是假的吗?

    @小二 #17

    翻了一下原paper,https://bmcmedethics.biomedcentral.com/articles/10.1186/s12910-019-0406-6

    Again,我个人不是empiricist,学过相关课程,但是不在做前沿研究,有做宏观或者计量的大拿欢迎提供更专业的意见…


    首先看COTRS 2017 data,这个是aggregated的每年数据。7个数据点2此项拟合可以达到>0.999,还是很高的,但是不能排除可能性。文章的这段discussion非常好

    The R-squared statistic can be difficult to interpret correctly. It is problematic to apply a formal statistical significance test to this data to determine whether it is too close to a quadratic curve, primarily because the behavior of structural growth in an industry, especially one involving as many contingencies as voluntary organ transplantation, is difficult to quantify. For this reason the same measures of closeness of fit were calculated for comparable data for 50 other countries from the Global Observatory on Donation and Transplantation (GODT) database.

    在双11的例子中,我可以用天猫的数据(毕竟需要第三方审计满足上市公司的信息披露要求)作为benchmark,开判断双11数据的准确度。但是这篇文章找不到中国真实可信的benchmark的数据,所以用了其他国家的数据做benchmakr,然后发现中国器官移植数据的数据过于标准了…

    It was found that when fitted to quadratic equations, every other country was between one and two orders of magnitude further away from the perfect R-squared of 1 compared to China. Of all other countries, the closest R-squared was 1.30% away from a perfect 1, with others ranging down to 99.9% away from 1; China’s three values ranged between .112% to .0478% away from 1. It was further discovered that the mean squared errors of China did not conform to the pattern exhibited by all other countries.

    当然,后面作者还用COTRS 2017 data做了一些robustness tests。我看来这个COTRS 2017 data数据的确有点可疑。

    后来,作者还pick up了一些Central Red Cross data的数据,这个是细化的短期数据,有更高的variability。作者讨论了5个不同寻常的数据点,作者认为是manipulation。有这种可能,但是manipulation实在是很难证明的,也可能有其他解释(比如数据平时可能遗漏,在年末审计的时候被找出来更正),我个人对作者对这一个Central Red Cross data数据的讨论存疑(至少还需要找其他benchmark来比较)。

    作者最终结论:

    The first is that the unusual and anomalous features in the data are due to deliberate human intervention. We believe this is the only plausible explanation for the qualities identified in the COTRS, and central and provincial Red Cross data, which include mirroring of quadratic formulae, stubborn adherence to arbitrary ratios, anomalies that abrogate the mathematical integrity of data series, unsubstantiated growth patterns, and other irregularities. It is difficult to imagine how such data from three sources could have come to possess these qualities if not for deliberate, ongoing and imperfect human intervention.

    The second is that this intervention could not have been piecemeal or without forethought.

    同意第一个,毕竟数学统计分析看上去plausible,但是第二个结论有点想当然,不是用数据在说话。

    --

    @笑翻江山 #19

    淘宝假货还是很多的,天猫少一些…

    @rrrr #20

    只要用没有造假的真实benchmark进行对比,假的数据就很容易被发现的… 从数据上来说,从常识来说(上市公司的数据需要通过第三方审计,所以造假的成本很大,因此天猫的年数据应该是真的;在此前提下,双11的数据也应该是真的),我认为双11的确没有造假…

    @Merlin #21

    “sorghum harvest” 这个梗很隐秘啊,我之前看的时候怎么都想不通,后来搜到其他人的解释才明白… 然后去搜了相关报道,恶心了半天…

  12. xyz   在小组 2049BBS 回复文章

    Google使用算法技术以外的手段人工干预排序。

  13. xyz   在小组 2049BBS 回复文章

    ~全文~《当谷歌遭遇维基解密:阿桑奇与施密特对话录》

    @magnus #13

    是你在这个 https://2049bbs.xyz/t/501 帖子中的那边书吗?对了,我最近想从Assange和Snowden这两个人的书中选一本看看,比如你提到的密码朋克和Permanent Record,这两本书那本更有趣味性啊?

    我是还是电脑技术小白,太过于技术的的书现在比较头痛...

    谢谢:)

  14. xyz   在小组 2049BBS 回复文章

    方可成:我被网络暴力的五天

    嗯嗯,多谢推荐,放在收藏夹中了,隔一段时间去翻一翻:)

  15. xyz   在小组 2049BBS 回复文章

    贴吧的回忆贴之我所见的贴吧

    @sorrysorrysorry #6

    没混过贴吧,我在国内只参加过以此大学bbs的聚会,大家都在撸串...

    哇,你们吧友聚会好上档次... 连老板都参加的!嗯,吃的应该不错,流口水ing...

  16. xyz   在小组 2049BBS 回复文章

    中国计划生育纪录片《独生之国》(One Child Nation)

    在amazon买买买的时候看到的,看了一点点,太沉重了,很痛苦... 写到这里,写不下去了... 需要去运动发泄一下...

  17. xyz   在小组 2049BBS 回复文章

    ~全文~《当谷歌遭遇维基解密:阿桑奇与施密特对话录》

    @magnus #8

    多谢多谢,谈的深入浅出,很有意思...

  18. xyz   在小组 2049BBS 回复文章

    贴吧的回忆贴之我所见的贴吧

    @sorrysorrysorry #1

    一脸懵... 想八卦都找不到入口,robin li是百度的那个吗?

    这个八卦有点隐晦....

  19. xyz   在小组 2049BBS 回复文章

    学院资料备份

    @逻辑思维 #6 @BE4 #2

    多谢两位:)


    @BE4 #2

    另外我也贡献 一下经济方面的教材:

    我个人推荐的经济学教材:

    微观经济学:

    • Microeconomics Theory by MWG https://www.amazon.com/Microeconomic-Theory-Andreu-Mas-Colell/dp/0195073401
    • Microeconomic Foundations by Kreps https://www.amazon.com/Microeconomic-Foundations-Choice-Competitive-Markets/dp/0691155836
  20. xyz   在小组 2049BBS 回复文章

    Google使用算法技术以外的手段人工干预排序。

    @勃列日涅夫 #15

    嗯嗯,这些contractors应该是给algorithm提供training的,并不是直接影响排名,只能通过training来影响...

    应该是这样理解吧...

  21. xyz   在小组 2049BBS 回复文章

    辩论的作用,以及对论坛辩论的一点想法

    @Merlin #54

    哦,有可能,我们第一年qualify后要踢掉一半以上,所以都卯足了劲拼命... 然后接下来每年的paper,以及proposal和defense基本不fail人... 大家都很放松的...

  22. xyz   在小组 2049BBS 回复文章

    辩论的作用,以及对论坛辩论的一点想法

    @小二 #52 @BE4 #49 @Merlin #45

    太可惜了,蛮理智和有干货的一个人...

    话说不应该是qualify之前很辛苦,然后就很轻松了吗?我当时qualify之前,每天只能睡5-6个小时... qualify之后就放飞自我了...

  23. xyz   在小组 2049BBS 回复文章

    专门开一帖讨论2049bbs的发展

    @sorrysorrysorry #63

    哇,是真的呃,品葱学院消失了... @BE4 你有备份吗?能在2049再发一下吗?多谢

    以防万一,把互联网收藏夹也发一次吧。现在这个还没有被删,但是我不是原作者,还是原作者转发比较好:)

  24. xyz   在小组 2049BBS 回复文章

    Google使用算法技术以外的手段人工干预排序。

  25. xyz   在小组 2049BBS 回复文章

    Google使用算法技术以外的手段人工干预排序。

    @勃列日涅夫 #10 #11

    Google似乎也像政府一样,要增加透明度、可问责。这点绝对没错。

    我其实很矛盾。一方面google的影响实在太大,它提供的服务都不像一个可选择的私人商品,都像一个utility了,对这种utility(类似于水,电),增加透明和问责我的确支持。另一方面,又有点担心扩大政府的影响和权力(想象一下由政府来监督什么样的信息才能出现在搜索结果中这种恐怖情况),私人企业和公民的权力越来越不能制约政府权力了。矛盾啊...

    比如为什么要靠人工标注(contractors)选择他们喜好的排序。其实人工智能算法很大的一类是“有监督的学习”,就是从人工标注的数据中学习,没有人工标注就没有人工智能了,这是免不了的。

    是啊,contractors应该就是用来帮semi-supervised learning或者supervised learning标注的吧... 其实我很好奇,为什么不能用unsupervised learning呢?Google不担心因为这些contractors的偏见导致标注出现偏差,从而人工智能学习的结果也会展示这种偏见吗?

    最近在学习machine learning的知识,但是主要集中在大数据和数据降维的理论这一块,还没有碰过supervised learning这一块... 能否解释一下为啥google选择supervised learning这种吗?

    从它的叙述没有看出Google是为了敲诈ebay的广告费才降低它的排名。甚至能看出排名与是不是大金主无关,因为ebay就是在Google投放了大量广告。

    嗯嗯嗯,我主要的担心是连Ebay这种大公司都有可能被google所威胁和影响,不用说其他小公司了... 从这点上看,我支持拆了google...

    没有投广告就不给协助了,这条确实问题比较大。

    嗯嗯嗯,同意,影响了其他行业的公平竞争原则...

  26. xyz   在小组 2049BBS 回复文章

    Google使用算法技术以外的手段人工干预排序。

    @勃列日涅夫 #6

    算法并不见得比人公正。人是有偏见的,算法同样有偏见。auto-complete联想出来的一系列偏见的结果。

    嗯嗯,我同意。我的想法是与其用google工程师的偏见去纠正用户的偏见,还不如在出现有争议的内容时取消这些auto-complete,就像yahoo一样。如果有google工程师的介入,定义什么是“合适的可以出现的”auto-complete,那么只是在用google工程师的偏见去覆盖用户的偏见,都不可取...

    搜索引擎是在跟人斗,不是在跟机器斗。网站为了排名高,会不断发明出各种新的作弊手段。算法跟不上,算法判断不出来,就需要人工干预。

    这个我认为这就是猫捉老鼠啦,出现作弊手段,google就可以去补漏改进算法。如果说算法判断不出来,需要人工干预,我觉得是google的工程师不够努力... 呃,我好像过于资本主义的嘴脸了...

    @小二 #7

    联想词很容易出现你所说的 offensive case 的问题,这个问题的本质就是,机器学习是从人产生的数据中学习,人是怎样,机器就学成那个样子。但是,我们都知道有些东西符合人性,比如色情,歧视,脏话等,但是不能出现在正式场合,这种情形就需要人工介入,去定义这些 special case。

    和回复 @勃列日涅夫 ,差不多,我觉得只要是人都有偏见;不存在一个偏见好于另一个偏见;我们需要的是如何定义我们认为好,它的标准是什么,如何识别,把这些规则给算法,让算法去判断。

    我个人倾向于:人是制定规则,机器是执行规则的;当机器执行的规则导致的结果是人不想要的,那么人应该改进规则,而不是帮机器去执行规则。

  27. xyz   在小组 2049BBS 回复文章

    Google使用算法技术以外的手段人工干预排序。

    @勃列日涅夫 #3

    这个我认为还是公说公有理,Google提供了算法,其他人explore算法,我认为是合理的;如果Google觉得不公平,那它可以改变更新算法。另外Ebay的说法是:这不是一个单一的事件,是长期的持续的打击(“We’ve experienced significant and consistent drops in Google SEO for many years”)

    具体的WSJ关于EBay的讨论如下。

    Online marketplace eBay had long relied on Google for as much as a third of its internet traffic. In 2014, traffic suddenly plummeted—contributing to a $200 million hit in its revenue guidance for that year.

    Google told the company it had made a decision to lower the ranking of a large number of eBay pages that were a big source of traffic.

    EBay executives debated pulling their quarterly advertising spending of around $30 million from Google to protest, but ultimately decided to step up lobbying pressure on Google, with employees and executives calling and meeting with search engineers, according to people familiar with the matter. A similar episode had hit traffic several years earlier, and eBay had marshaled its lobbying might to persuade Google to give it advice about how to fix the problem, even relying on a former Google staffer who was then employed at eBay to work his contacts, according to one of those people.

    This time, Google ultimately agreed to improve the ranking of a number of pages it had demoted while eBay completed a broader revision of its website to make the pages more “useful and relevant,” the people said. The revision was arduous and costly to complete, one of the people said, adding that eBay was later hit by other downrankings that Google didn’t help with.

    “We’ve experienced significant and consistent drops in Google SEO for many years, which has been disproportionally detrimental to those small businesses that we support,” an eBay spokesman said. SEO, or search-engine optimization, is the practice of trying to generate more search-engine traffic for a website.

  28. xyz   在小组 2049BBS 回复文章

    Google使用算法技术以外的手段人工干预排序。

    @Merlin #2

    这个行为,我看来是影响了公司之间的competition了,特别是出钱越多的公司(一般是大公司)更能得到越多的信息,小公司没钱得到的exposure就小;长久以后,市场准入的门槛就越来越高;市场最后就变成了monopoly 或者 oligopoly... 苦了消费者...


    facebook的数据管理臭名昭著... 话说我之前还有一些他们的用户数据做social network mapping...

    不知道包不包括2049上各位的数据....:)

  29. xyz   在小组 2049BBS 回复文章

    Google使用算法技术以外的手段人工干预排序。

    @小二 #1

    为什么必须需要人工干预呢?人的目的和想法太多了,人工干预就是一个zero-sum,希望出现的那个词赢了,被人工干预消失的那个词输了... 用算法比较直接和透明吧...

    我其实同意Yahoo/DuckDuckGo的方法,要不不显示auto-complete(如果联想的词太offensive),如果显示auto-complete就不要任何人工干预。

    Gabriel Weinberg, DuckDuckGo’s chief executive, said that for certain words or phrases entered into the search box, such as ones that might be offensive, DuckDuckGo has decided to block all of its auto-complete suggestions, which it licenses from Yahoo.

    我个人是讨厌任何人工干预,提倡一切交由算法的(这也是2006年之前的google的核心原则)...


    看看WSJ这篇文章的影响吧,我是从这篇文章中读出了不单影响搜索引擎的竞争,而且通过支持大公司打压小公司从而影响了其他行业的竞争的这种结论。如果是这样,那么拆分就是自然而然的结论了。


    政治的方面我不懂... 但是文章的确隐含了google打压conservative偏好liberal的意思...

  30. xyz   在小组 2049BBS 回复文章

    五毛具体是怎么工作的?

    @碧游宫 #13

    这个,有logic fallacy就是在说你说的或者你引用的话是没有逻辑或者逻辑错误的话...

    如果你说逻辑错误的话是实话,而且必须听,那么我也没有办法继续讨论了...

    另外,你回的这一句话有还是有shotgun argument的问题,另外也许要加上隐含的ad hominem fallacy...

  31. xyz   在小组 2049BBS 回复文章

    五毛具体是怎么工作的?

    @碧游宫 #9

    我记得编程随想好像说过这个.... 找到了“五毛谬论点评——“每个国家都有审查制度” https://program-think.blogspot.com/2012/12/censorship-in-china.html

    你的这个argument好像是典型的Tu Quoque Fallacy (aka, appeal to hypocrisy)。另外,还有一点shotgun argument的问题...

    还是先理清逻辑再说话吧...

  32. xyz   在小组 2049BBS 回复文章

    专门开一帖讨论2049bbs的发展

    @小二 #36

    嗯嗯嗯,不用急,其实你更懂网站管理啦,我有点班门弄斧了... 你看看什么有道理就考虑考虑,幼稚的建议就一笑而过吧:)

    2049的气氛现在还算不错的,而且我学到了一些从来没有了解的知识,很开心... 可怜我之前常驻的huaren.us,最近一两年开始出现一群职业捣乱的,华为出事和香港事发以后更厉害,特别是大使馆的helloterren系列ID,廊坊的wangbing,哎,一言难尽啊... 后来站主歪哥暗示自己大概率被策反,从此huaren.us朝着国内网站的趋势义无反顾地走了下去...

    其实我很矛盾的,有希望多一些人气,多一些能有自主思想有干货的ID,又怕人多了以后又变成新品葱或者huaren.us一样的泥沙俱下...

    嗯,继续去刷演员请就位了...

  33. xyz   在小组 2049BBS 回复文章

    辩论的作用,以及对论坛辩论的一点想法

    @sorrysorrysorry #41

    我和他没有交流呃,不过还很喜欢他的,说话有逻辑,有干货:)

    @小二 @BE4 能邀请他吗?

  34. xyz   在小组 2049BBS 回复文章

    专门开一帖讨论2049bbs的发展

    @Spikeevin #11

    好的好的,我也加入:)

  35. xyz   在小组 2049BBS 回复文章

    专门开一帖讨论2049bbs的发展

    @Spikeevin #8

    nod,nod,我还是很喜欢品葱学院的:)

  36. xyz   在小组 2049BBS 回复文章

    专门开一帖讨论2049bbs的发展

    周三还是周四在https://2049bbs.xyz/t/1654 随大流写了一大段的建议,在数据回滚的时候丢失了,然后在https://2049bbs.xyz/t/1688 答应 @小二 重新写一下,既然已有这个专门的帖子了,就现在大体回忆补充一下…




    主要提议: 1. 论坛分三个栏目区分流量和质量需求,2. 在首页使用可视化 同时呈现 此三栏目,方便需求不同的网友快速直接地找到自己找到感兴趣的板块,并根据自己的需求在不同板块发帖留言交流。

    以下具体分析展开一下:


    需求分析: 我对论坛的需求首先是八卦聊天,然后是看有质量的文章开阔自己的思维视野。但是我能感到很多网友对时事政治建政(其实我不知道建政是什么意思,google了也没找到详细解释)很感兴趣。


    具体建议: 根据需求分析,我推荐网站分三个栏目:【时事,新闻,政治】,【深度,原创,分析】,和【休闲,聊天,水】。这三个栏目 同时 并排或者先后在主页呈现,有不同的需求的用户选择不同的入口,同一个ID可以在所有的栏目发帖留言,但是三个栏目各有不同的规则和展示方式。在每个栏目的发帖保留不同的tag/节点,以方便搜索(比如点击Geek节点,可以搜索出三个栏目中所有有Geek的帖子,用不同颜色或者标记呈现);发帖时,需要选栏目和节点。

    1. 【时事,新闻,政治】:主要是面对时效新闻和事件的评述交流。

      • 栏目形式我人为Hacker News这种形式比较合适:我个人认为对时事的交流主要是由某个特殊的事件或者新闻trigger的。比如WSJ今天在大字报Google在有意改变你的搜素结果,或者北京战士在清理HK街道,这种新闻可能会引起网友的讨论需求。为了防止主贴像新品葱一样就是一句话“大家怎么看某某事件”这种情况出现,在这个栏目发帖的时候需要 强制 输入新闻或者消息来源,让其他读者能知道事情的来龙去脉,从而使得讨论有具体的事实基础。
      • 首页排序我推荐使用热度排序。在一段时间内越多点击越多评论的帖子在主页栏目展示中排序越高。类似Harcker news的排序方法。当然,进入这个栏目后帖子的排序还是用回帖顶贴的方式排序;进入单个帖子后回帖的排序也可以用时间排序或者赞来排序。
      • 栏目规则:应该允许所有ID在此栏目发言,没有任何门槛。长短发言没有所谓,适当逻辑混乱没有问题,适当调侃也没问题,轻微阴谋论也正常。但是禁止辱骂,言语攻击,和复读。
    2. 【深度,原创,分析】: 主要是面对有干货,希望能深入交流的网友;或者希望开阔思维的CD-ROM(比如我本人…)。

      • 栏目形式我人为知乎的形式比较合适:主贴可以是自己的原创想法,见解,和分析(比如Merlin的”闲谈古典音乐”),或者对资料的总结(比如 天神九頭鳥 总结的秦晖的”从诸子争鸣到新文化运动”)。同时希望像知乎问答一样给每个回帖人一个自己的小回帖区,其他人如果对某个回帖者的回答有疑问,可以在这个回帖者自己的回帖区和其他人交流,而不会占用主贴的版面。
      • 首页排序我推荐使用知乎发现的方法。进入帖子后的回复用赞和时间的tradeoff排序。
      • 栏目规则:主贴和回帖都应该限定最少字数。允许发帖的ID可以设立一定的门槛(比如a. 注册超过1个星期,发言多于20条,发帖多于5个的ID – 时间是瞎写的;从而使新ID搞清2049三个栏目的定位以后再发帖;b. 站长/其他ID邀请或者核查制 – 类似旧品葱)。发帖回帖首重资料和深度,不欢迎抖机灵,不欢迎逻辑不自洽的发言。禁止辱骂,言语攻击,阴谋论,和复读。
    3. 【休闲,信息,水】:主要是聊天,八卦,提醒,分享时效消息啦…

      • 栏目形式我人为现在的2049bbs的贴吧形式就很好。
      • 首页排序我推荐保留2049使用顶帖排序。回帖帖用时间排序就好。
      • 栏目规则:允许所有ID在此栏目发言,没有任何门槛。长短发言没有所谓,适当逻辑混乱没有问题,适当调侃也没问题,适当阴谋论(有时候八卦过头也很像阴谋论的…)也没有问题,但是禁止辱骂和言语攻击。

    最终目的: 最终目的是用流量栏目来吸引新用户,通过流量栏目来知会新用户2049的规则,通过展示流量栏目和质量栏目来过滤新用户,从而让有干货的ID可以在质量栏目进行交流从而产生更多的好文章。

    现在2049没有把栏目和tag/节点分开,是把水和时政的节点置顶了,希望不同需求的用户自我选择节点。但是从首页展示的帖子上并不能区分,用户的三种需求并没有分开,因此在没有对新ID教育的情况下,时政的帖子还是可以用问答节点(或者在发帖中使用默认的问答节点)在首页展示。因此,我还是推荐分三块块同时在首页分开展示这三个栏目。


    好了,我能想到的都说了,还是不习惯写长文… 我是一个编程小白,不负责任地做冷气军师(刚学的词,希望没有用错…),如果coding太辛苦太复杂,就算了…

    我从来没有管理过网站,所以想法有点异想天开,不和现实,请勿见笑… 从另一个角度想,各位大拿,你们看,我这种幼稚的建议也能提出来,您怎么好继续敝帚自珍呢:)

    追综艺节目去了,匿了,匿了…

  37. xyz   在小组 2049BBS 回复文章

    闲谈古典音乐(二)

    @Merlin #14

    哇哇,太好了,支持支持。今天下午去修车(倒车入库把侧视镜刮了....),多下载点音乐在等的时候听:)

  38. xyz   在小组 2049BBS 回复文章

    electron8964居然也撤离超管队伍了

    他发的图很有意思...

  39. xyz   在小组 2049BBS 回复文章

    辩论的作用,以及对论坛辩论的一点想法

    @Merlin #5

    而且这种非常严格的辩论看起来也很累的... 让我想起写referee report的痛苦...

  40. xyz   在小组 2049BBS 回复文章

    已经实现自定义忽略用户的功能

    @小二 #47

    好吧,我周日再写写... 今天上午系里开会,下午去修车,周六约了朋友去吃学坐火车:逛吃,逛吃,逛吃...:)哇哈哈...

  41. xyz   在小组 2049BBS 回复文章

    辩论的作用,以及对论坛辩论的一点想法

    @Merlin #36

    大拿,不要这么损我这个正在学习如何推荐股票的...

    你看,我也学会这个艮了:)

  42. xyz   在小组 2049BBS 回复文章

    辩论的作用,以及对论坛辩论的一点想法

    @梅菲斯特 #1

    并不是不喜欢辩论... 只是不喜欢和没有逻辑但是死要面子的人吵架...

    你这么一说又让我想到了小钙和rtg的那次辩论,小钙已经指出rtg在用tautology这种无聊的方法了(其实还有straw man和false equivalence),但是rtg就是不承认,顾左右而言它,转换话题。在这种情况下辩论没有任何意义... 浪费时间罢了...

    其实如果喜欢辩论,你可以看看能否成为学者。写paper其实就是在辩论,为什么你认为其他人的结论有问题,你是怎么解决的,为什么你的方法比其他人好,会辩论会讲故事才能写好一篇文章...

  43. xyz   在小组 2049BBS 回复文章

    已经实现自定义忽略用户的功能

    @懦夫斯基 #30

    开心,还是有人看到了,也不枉我敲了很一会键盘了:)

    @BE4 #31

    我当时就在想,yesterday is not a good day for you... 刚刚不用日抛型账号进行讨论,然后大多数讨论都在数据回滚中消失了...

    昨天我也回过你一条(无意外地在数据回滚中丢失了,不知道你是否看到),不高兴重复长篇大论了... 大体上建议你可否先进行一个你认为可行的项目,比如那个“读书分享会”(还是其他什么名字,不太记得了),如果你自己的项目能在你的推动和组织下成功,也更有可能说服小二或者其他的ID支持你其他的项目(比如,Hacker news,分区,这些)。你认为如何呢?

    @小二 #35

    我昨天写了一些关于如何分区,如何筛选用户需求,如何把流量从质量中分离和反哺质量,如何排序,如何首页展示的一个建议(现在丢失了...)。如果有必要,我周末可以再写个大概... 不过如果你觉得没有必要,或者coding工作量和可能成效不成比例,就算了,毕竟不想让站长忙得爆炸了...

  44. xyz   在小组 2049BBS 回复文章

    对这次丢失数据的总结

    恭喜完成隐藏任务:找到月关宝盒回到一天前改变历史...

  45. xyz   在小组 2049BBS 回复文章

    天猫双11数据是假的吗?

    @asdfgh #14

    哇,多谢大拿,撒花:)

    补上之前的讨论




    背景知识

    数学分析中有一个Stone–Weierstrass theorem,它表明任何连续曲线都可以用多项式来逼近... 所以多项式power越高,逼近效果越好(R^2越大)...

    然后如果有n个点需要用(m-1)次的多项式曲线来逼近(加上intercept,一共有m个常数)。

    • 如果n<m,那么有多个polynomial曲线可以完全拟合这n个点(R^2=1)。

    • 如果n=m的时候,相当于用n个方程来解m个常数,这个时候只有一条曲线(如果degree of freedom等于n的话)可以完全拟合这n个点,所以R^2=1。

    • 如果n>m,相当于解一个minimization问题(square root 或者是 absolute value的minimization),这个时候R^2<=1;当然,当m越大的时候,逼近越好(R^2越高)... (比如在双11的例子中,你会看到点越少,三次方程拟合越好(R^2越大))


    双11数据辨伪思路

    单看双11的拟合R^2,在我看来没有什么意义。如果需要推测双11的数据是否造假,需要一个真实的非造假的benchmark。我选的是天猫的每年GMV。两个原因:1. 双11是天猫的,最终销售额需要计入天猫每年的GMV中;2. 双11的销售量是短期的,而天猫的GMV是aggregated的长期数据,长期数据比短期数据更难造假(毕竟上市公司的年审计还是很严格嘀,造假比较难,成本比较大)。

    我的检验方法有一个前提【假设天猫每年的GMV是真实未被操纵造假的】。当然,如果你要说用accounting或者operation的方法也可以操纵每年的GMV,我也承认没错,所有的商业数据都可以操纵;但是和短期数据比起来,操纵对长期数据的影响来说更小。

    假定天猫的数据是真实的,如果双11的数据和天猫的数据behave in the same fashion。那么我很难证明双11的数据是假的,只能接受双11的数据没有被操纵这个前提假设。


    正文讨论解释

    正文中我写了两个目的:

    (1). 看看aggregated 天猫GMV是不是也可以被3项式拟合;

    第一个目的是为了看看双11的R^2在0.99这个值是不是可信的。通过看天猫的数据R^2也在0.99附近(ref:正文第一个图),所以我觉得双11的数据在0.99附近没有问题。

    (2). 双11和天猫的数据拟合曲线是不是相似。

    我在正文中指出“拟合曲线以及residual value的正反两张图都是相似的”。特别是residual value的正负值在不同年份,天猫的数据和双11的数据都可以一一对应。所以我觉得双11的数据“数据增长和天猫GMV的增长是吻合的”。当然,可以更科学地去做redidual分析,或者用log等变化多做几次分析,有兴趣的人自己去看看...

    结论,如果天猫GMV的数据没有问题,我认为双11的数据也没有问题。


    最后,补两张线性逼近和二次逼近的图。数据进行了standardize,方便比较天猫和双11的数据。

    321.jpg

  46. xyz   在小组 2049BBS 回复文章

    已经实现自定义忽略用户的功能

    @小二 #21

    多谢,多谢,这回block功能就非常完美了...

    真的好像丢了一些数据啊... 之前早上写的回【打算创建一个「公民学会」,想听听大家的想法?】https://2049bbs.xyz/t/1654 那个帖子好像不见了... 希望消失前你们已经看过了... 我没备份,都是现打的...

    不过,辛苦了,一个人做了这么多的工作,谢谢:)

  47. xyz   在小组 2049BBS 回复文章

    天猫双11数据是假的吗?

    额,之前详细写的总结在这次数据回滚中消失了... 没有备份,也懒得重写了...

    大概不用数学地讲一下。

    数学背景: 数据拟合的数学支撑是Stone–Weierstrass theorem。基本上任何数量的数据点(不管是finite还是uncountable),都可以被polynoimal方程完美拟合,方程power越高,拟合越好(R^2越高)。比如n个点用m次方多项式(算上intercept项)拟合,当m+1>=n时,都可以完美拟合(R^2=1);当m+1<n的时候,m+1越高,拟合越好(R^2越大)。

    方法: 我看了两点,第一R^2>0.99的拟合度是否可信;第二双11的销量数据是否可信。用的方法是找到一个aggregated数据天猫GMV(假定这个数据是真实不造假的),用这个数据和双11的数据进行benchmark。

    结论: 1. 天猫每年的GMV数据,3项式拟合R^2是0.9966,所以双11的0.9983,看上去是可信的(当然,严格的人可以用hypothesis test);2. 一次项,二次项,三次项的天猫和双11的拟合曲线很相似,更重要的是residual value和拟合曲线的正反值相似(同样,可以做更多的redidual value的分析,可以做更多的transformation,比如standardize啦,log啦,这些)。因此,在这两个结果上,假定这个天猫的数据是真实不造假的,我没办法说双11的数据作假了,只能接受双11没做假这个前提假设。

    碎碎念: 当然,因为天猫的数据需要审计,所以每年的GMV数据应该不会造假,但是可以用accounting和operation的方法进行调整,已到达避税的目的。但是大规模造假应该不可能。

    双11是短期数据,可以调整的方法更多,比如通过预售啦, 短期incentive啦,推迟结算啦,这种做法把之前几个月和之后几个月的demand在双11这一天进行释放。但是从之前的数据分析看来,天猫双11的增长和天猫每年的GMV增长是吻合的,并不能说双11作假了。或者可以说,如果天猫每年的GMV没有作假,那么双11的数据也没有作假...

  48. xyz   在小组 2049BBS 回复文章

    废除中华人民共和国后军政府主要政经举措:

    @1 any rfc for such a scenario? Check above...

  49. xyz   在小组 2049BBS 回复文章

    天猫双11数据是假的吗?

    @louzigege #1

    这也是我正文中说的操纵短期销量数据的方法之一,应该不算作假,商业规则和行为吧...

  50. xyz   在小组 2049BBS 回复文章

    天猫双11数据是假的吗?

    @Merlin #3

    嗯嗯,prime day是个很好的benchmark呀。0.9999也真是高到一定程度了...