發(fā)布時間:2026-10-08 06:32:51 來源:kiss電子煙購買 6677599 作者:時尚
▲DiDi_OK創(chuàng)作時的憑分頻拿Veo界麵 圖/受訪者提供
因為一塊牌子,人類喪失了語言能力。鐘視重為重建巴別塔,百萬爆人類開始用emoji交流,獎金最終協(xié)力飛上太空,說審一腳踢飛了禍亂的美最根源——火星上一塊寫有“?”的牌子。
這是憑分頻拿B站UP主“DiDi_OK”在2026年2月發(fā)布的AI短片《牌子》中的創(chuàng)想。導(dǎo)演郭帆給短片留言說:“太......牛逼!鐘視重PS:老勃魯蓋爾和青蛙都出來了,百萬爆超喜歡!獎金”截至2026年4月23日,說審《牌子》在B站上的美最播放量1899萬、在YouTube上的憑分頻拿播放量123萬。
《牌子》講述了這樣的鐘視重故事:人類世界出現(xiàn)了許多類似路牌的牌子,不論它的百萬爆內(nèi)容有多荒誕,都會如實地出現(xiàn)在現(xiàn)實世界裏,比如棕熊在橋上騎自行車;成群的奶牛從山坡滾落;地鐵禁止乘坐,內(nèi)部變成了失重環(huán)境;“勿視勿言勿聽”的三不猴形象出現(xiàn)在天上,人們無法說話,也聽不懂他人的語言……
DiDi_OK憑借《牌子》斬獲B站首屆“AI創(chuàng)作大賽”的一等獎,拿到了100萬元人民幣的獎金。DiDi_OK是個廣告人。2025年4月Runway Gen-4發(fā)布後,他嚐試用Runway製作了自己的第一支AI影片,並意識到視頻製作不再是人類的天下。然而,他想做的特效和美術(shù)風(fēng)格,有90%都是AI實現(xiàn)不了的。他一度對朋友說:“我這輩子都不想動AI了。”
2025年下半年以來,許多科技公司想方設(shè)法地將AI視頻工具轉(zhuǎn)化成真正的生產(chǎn)力。Runway、CapCut、TikTok、Adobe都舉辦了相關(guān)活動,鼓勵用戶通過AI生產(chǎn)視頻內(nèi)容。正如B站在“AI創(chuàng)作大賽”推送中所言,“這不隻是個創(chuàng)作比賽,更是一個利用AI技術(shù)進軍影視製作行業(yè)的機會。”
海量創(chuàng)作者正在擠入AI視頻的藍海,僅B站的比賽就收到了超過8300份有效稿件,累計播放量超過7億,其中播放量超百萬的視頻有143部。
AI視頻生成公司Runway的官網(wǎng)解釋了為什麼創(chuàng)作者越來越青睞AI工具:“從最初的創(chuàng)意構(gòu)思到生產(chǎn)階段,Runway可以幫助您的團隊加快速度並銷售更雄心勃勃的想法,同時降低您的成本。”概括來說就是“降本增效”。
在增效方麵,傳統(tǒng)影視行業(yè)的效率已難望AI之項背。據(jù)中國網(wǎng)絡(luò)視聽協(xié)會發(fā)布的《中國網(wǎng)絡(luò)視聽發(fā)展研究報告(2026)》,2025年由AI生成的視頻/音頻超20億條,較2024年增長了14倍以上。
2026年4月5日,在短劇平臺紅果上,《菩提臨世真人AI版》登頂熱度榜第一。這是AI短劇首次超越真人短劇。市場的反饋清晰地顯示了觀眾對AI內(nèi)容的青睞。
AI內(nèi)容的井噴也給了傳統(tǒng)影視行業(yè)沉重的一擊。北美的特效公司近年開始經(jīng)曆倒閉潮。曾參與製作《哈利波特》、《速度與激情》等影片的頭部視覺特效公司MPC於2025年2月正式宣布關(guān)停,它曾是好萊塢、迪士尼的重要合作夥伴。
法國戰(zhàn)略諮詢公司PMP Strategy的報告指出,生成式AI可能導(dǎo)致視聽行業(yè)多類崗位收入下滑。其中,受影響最嚴(yán)重的是譯製和改編,降薪幅度可達56%,而編劇為20%、導(dǎo)演為15%。報告還估計,到2028年,視聽創(chuàng)作者年度總收入的下滑幅度可達21%,折合金額約為45億歐元。
美國諮詢公司CVL Economics調(diào)查了300位娛樂行業(yè)高管和中層員工,75%的受訪者認為,生成式AI已經(jīng)導(dǎo)致了其部門崗位的削減和整合。CVL Economics測算,到2026年,美國的電影、電視和動畫崗位中,約21.4%即11.85萬個崗位將被整合或消失。
DiDi_OK仍對AI視頻時代的“人”抱有信心。他認為人的審美將會前所未有的重要,創(chuàng)意和經(jīng)驗依然無可替代。他打了個比方,廚藝精湛的廚師從傳統(tǒng)小灶進入全自動化廚房,炒菜隻會比原本更好吃。
AI雖然是高效的工具,但提供不了《牌子》的創(chuàng)意。視頻的靈感源自DiDi_OK在土耳其旅遊時看不懂路牌的切身經(jīng)驗,這是非常“人類”的難題,而知識廣博的大模型,恐怕不會有語言障礙的困惑。
圍繞AI短片的創(chuàng)作、AI對內(nèi)容行業(yè)的影響,我們與DiDi_OK進行了討論。在他所處的歐洲廣告公司,小團隊是趨勢,但AI不是唯一的解法。在他看來,AI在生成真人表演上還非常薄弱,AI視頻也還沒跨過初始階段。
▲土耳其的牌子 圖/受訪者提供
“AI沒有很強大,在我看來它弱爆了”
南方人物周刊:《牌子》的製作周期是23天,在AI出現(xiàn)前,你估計製作它需要多長時間、成本?
DiDi_OK:三年起步吧,我覺得成本至少是1000萬元人民幣。《牌子》實拍的話,水獺的鏡頭隻有十幾秒,但一定要找外國演員,給他們配備專業(yè)美國大兵的服裝,還要找一個能封路的美國社區(qū),哪個成本也省不了。
之前在英國拍虛擬製片,我隻是坐在現(xiàn)場幫他們操控一下那些模型,一天大概是2000英鎊。攝影棚一天的租金是10萬英鎊,操縱設(shè)備的工作人員要50人左右,現(xiàn)場需要至少5個3D藝術(shù)家實時修改屏幕上的內(nèi)容……還沒有開始拍,現(xiàn)場可能已經(jīng)站著一百多人,他們都是要發(fā)工資的,一天什麼都不幹就要10萬英鎊。
應(yīng)該是兩年前,很多虛擬製片項目的製片人非常焦慮,會不斷央求每一個人,“求你了,我們能不能今天就拍攝完?”因為到明天又是10萬英鎊的開銷。我們經(jīng)常會跟片方談,能不能早上6點開工,拍到23:50可以嗎?不超24點。
我們的拍攝簽約通常是一口氣簽五天,要將至少50萬英鎊打到對方賬上才能開始拍,成本非常昂貴,這導(dǎo)致我對幾千美元的成本變得不太敏感。創(chuàng)作《牌子》,我大約花了五六萬元人民幣。2025年製作的短片《綠幕》片長隻有兩分鍾,我花了2000美元。在我的視角裏,隻需要花2000美元就能自己拍出這個東西,這可太便宜了!
▲水獺實驗鏡頭 圖/受訪者提供
南方人物周刊:在內(nèi)容創(chuàng)作領(lǐng)域,小團隊模式是大勢所趨嗎?
DiDi_OK:它已經(jīng)開始了,三個人的團隊大量出現(xiàn),甚至一個人也可以。比如我現(xiàn)在負責(zé)的世界杯相關(guān)項目。這是業(yè)內(nèi)非常大的項目,但我也會跟客戶談,我要一個人做,不想跟任何人合作。AI生產(chǎn)力過於先進,不需要分工,更需要一個人的總體把控。
曾經(jīng),方案製定好後,就要去實拍,就要預(yù)約拍攝場地、找演員、找導(dǎo)演、租設(shè)備,這是非常耗時的過程,更不用說拍攝了。拍攝完還要修片子、做後期。現(xiàn)在這些都可以一口氣打包完成。也就是說,AI導(dǎo)致內(nèi)容創(chuàng)作會更趨向於製作人製,製作人手下不再需要一大群人。
南方人物周刊:你這樣的專業(yè)內(nèi)容創(chuàng)作者在AI時代將麵臨什麼?
DiDi_OK:AI其實沒有很強大,在我看來它弱爆了,它隻是一個工具。現(xiàn)在AI的使用率還是挺低的,我們先不說生成視頻的AI,哪怕是ChatGPT和豆包這種,我看了下數(shù)據(jù)也隻有20%左右的人用過。
我覺得,在歐美反對AI算是一種政治正確,網(wǎng)上有大量旗幟鮮明的反對聲音。當(dāng)然,衝擊也是有的。2025年11月,歐洲出現(xiàn)了第一波明顯的裁員。我們公司2025年年初花了好幾億英鎊收購了一家特效公司。但是,因為AI的發(fā)展,我們不需要他們了,11月就原地解散。不會用AI的新人,公司可能就不要了,但已有的員工是不受影響的。
▲DiDi_OK在工作中 圖/受訪者提供
南方人物周刊:AI多大程度上介入了你們的工作流程?在這種情況下,人的優(yōu)勢是什麼?
DiDi_OK:現(xiàn)在公司裏基本是全AI工作流,這個跟國內(nèi)會有一些差別。我們與穀歌合作,由它提供大語言模型,組建我們的agent(代理)。在項目前期我們從AI獲得基礎(chǔ)的靈感和方案,當(dāng)然還需要大家商量,確定出一個方向,接著開始生成方案圖,比如說幫三星做大量的概念設(shè)計圖、方案。這些曾經(jīng)會有很多人工參與,但現(xiàn)在基本上是AI在跑圖,它們確定之後,我們就可以生產(chǎn)了。總的來說,在製作端基本上沒有傳統(tǒng)的3D和實拍。
我覺得,我們傳統(tǒng)廣告人在AI時代最大的優(yōu)勢是對片子修改的耐受力,因為我們在過去的工作經(jīng)驗中已經(jīng)被甲方充分訓(xùn)練了。在傳統(tǒng)的3D製作中——例如我現(xiàn)實中的主要客戶,可口可樂、穀歌、三星——一個十幾秒的片段修改上千次是非常正常的量。這種經(jīng)曆使我有充分的耐心和經(jīng)驗在AI製作中反複調(diào)試鏡頭,並從中選出我最滿意的一個。
《牌子》中有個20秒左右的十字路口鏡頭(包含爬行的人、飛馳的遛狗老人、騎自行車的狗熊等畫麵),這個鏡頭我生成了一千次左右,是四個一組批量生產(chǎn),最終生成三千多條視頻。
▲十字路口部分測試截圖,每個畫麵其實是四個,因為可靈會四個生成為一組 圖/受訪者提供
審美變得前所未有的重要
南方人物周刊:在《牌子》中,生成一個鏡頭大概要多久?
DiDi_OK:每個模型都不同,比如“可靈”平均單個鏡頭的生成時間在5分鍾左右,我一口氣生成很多鏡頭的時候,它的時長會更長,這時候我可能會看電影、打遊戲。製作《牌子》的時候,我就這麼斷斷續(xù)續(xù)地看劇,竟然把《長安的荔枝》電視劇版看完了。
南方人物周刊:從最初接觸AI視頻到現(xiàn)在,你對它的理解發(fā)生了什麼變化?
DiDi_OK:2025年4月份剛用AI視頻工具的時候,我大概適應(yīng)了兩周。那段時間非常崩潰,我很厭惡這種不能控製的感覺,我想做的特效鏡頭、美學(xué)風(fēng)格,90%都完全無法實現(xiàn)。我跟朋友說,我這輩子都不想動AI了。
現(xiàn)在看到的AI視頻是篩選後的結(jié)果。我盡可能把滿意的鏡頭發(fā)出來,但背後是大量不滿意的鏡頭,有些鏡頭我會生成上千次。
在大量嚐試之後,我發(fā)現(xiàn)每一個工具都有自己的優(yōu)缺點,比如Nano Banana生圖最好,尤其能輸出4K;Veo的嘴型同步和穩(wěn)定性最強,隻要涉及人物對話就用它,但運鏡很呆板,角色老是正對鏡頭、站在畫麵正中間說話;可靈的運鏡有張力,能做很大的推拉,但畫麵容易拉伸變形;Runway的物理效果最牛,但不穩(wěn)定。而且,同一段鏡頭被幾個軟件生成,別人會覺得完全一樣,但在《牌子》裏,我會喜歡帶有微弱晃動感的那個鏡頭。這時候我會發(fā)現(xiàn),我其實是在人為做篩選。我認為,使用AI並不是做控製,而是在做篩選。
▲貪吃蛇追蹤細節(jié)展示 圖/受訪者提供
南方人物周刊:同一個鏡頭生成上千次,你的篩選標(biāo)準(zhǔn)是什麼?是基於過往的經(jīng)驗嗎?
DiDi_OK:選鏡頭就是審美,這非常主觀。梵高畫《向日葵》,他把向日葵往右畫3厘米,誰也不會覺得有問題,但他覺得有問題,對我來說也是類似的。很多鏡頭的運鏡、景別都非常完美,但我覺得少點什麼,我自己也不知道少點什麼。
我不太理解為什麼會有很多人認為有了AI之後,人就不需要學(xué)習(xí)審美了,我覺得它反而變得更重要了。曾經(jīng),藝術(shù)大部分的價值是在技術(shù)層麵,比如我會畫畫,雖然繪畫的思維不好,審美也不突出,但我手上功夫非常好,能畫得很像,就可以獲得社會資源的支持。但現(xiàn)在,單純“畫得像”已經(jīng)沒有意義了,你不可能比AI更像、更精準(zhǔn),那麼審美就變得前所未有的重要。
我過去的經(jīng)驗依舊是決定性的。舉個例子,在傳統(tǒng)廚藝裏,廚師還要自己劈柴、切菜,做什麼都依靠一把菜刀,但給他配備全自動化的廚房,他隻會做得更好吃。
同理,我認為創(chuàng)作是非常考驗肌肉記憶的事情。比如我們收到同樣的要求,生成一個小貓在窗臺上的鏡頭,我跟你做出來的百分百不同。如何表現(xiàn)這隻貓?用什麼樣的透視來拍攝?該怎麼運鏡?橫拍還是特寫?該怎麼描述運鏡中的光線?
AI視頻真正隨機的部分隻占10%,而人為控製占了90%。用AI生成視頻就像遊戲抽卡,你不能確切知道自己會抽到什麼。在這一係列的設(shè)定建立之後,我才會安心地抽3000次。
▲DiDi_OK 圖/受訪者提供
AI影像創(chuàng)作還未跨過起點
南方人物周刊:如果AI視頻要走向中長片甚至電影,你覺得有哪些問題亟待解決?
DiDi_OK:首先是分辨率,第二個就是表演問題。現(xiàn)在AI視頻最高的有效分辨率是1080P,普遍還停留在720P,這意味著很多細節(jié)都不能表現(xiàn)出來。最終AI視頻的目標(biāo)一定是上大屏幕,這也是它最能獲得資本青睞的方式。如果隻是走流媒體,分辨率的確沒有那麼重要。
南方人物周刊:我們現(xiàn)在看AI視頻會覺得畫麵比較油膩,這與低分辨率有關(guān)嗎?
DiDi_OK:這是一個美術(shù)問題。美術(shù)是美術(shù),技術(shù)是技術(shù)。舉一個例子,張藝謀導(dǎo)演的《英雄》——一部2002年的作品,那時的拍攝技術(shù)絕對落後於現(xiàn)在,但是現(xiàn)在看來《英雄》依然是非常美的。現(xiàn)在技術(shù)進步了,但製作者的美術(shù)水準(zhǔn)並沒有提高。
特效之類的都解決得七七八八了,現(xiàn)在的表演依然會讓人看出來它是假的。比如在《阿凡達》裏,卡梅隆花了特別多時間和經(jīng)費解決水的特效問題。作為普通觀眾,很少有人在乎某一個場景的水流是否合理。大家在乎的是潘多拉星球上,每一個阿凡達的麵部表情是否合理。
AI現(xiàn)在最擅長、也能有性價比的就是生成一些大場麵。歐美國家的觀眾更喜歡感官化的刺激,特別在YouTube或者Instagram上的爆款短片,通常都不是敘事類的。歐美比國內(nèi)更在意整活,反而是國內(nèi)的觀眾會非常有耐心,願意看創(chuàng)作者的敘事。
但現(xiàn)在AI生成的表演會讓觀眾很不舒服,就像預(yù)製菜一樣,我已經(jīng)知道它是預(yù)製菜了,你還要逼我坐在那裏看一兩個小時,這就有點過分了。我們完全無法接受大年三十和家人吃預(yù)製菜,還要細細品味,然後感慨一下,“哎呀!這個做得真好,這道菜火候真好。”這會顯得很愚蠢。
▲朋友家的感歎號 圖/受訪者提供
南方人物周刊:為什麼說AI視頻的表演是預(yù)製菜?
DiDi_OK:因為它是基於係統(tǒng)的算法提前準(zhǔn)備好的,不是導(dǎo)演與真人聊天、寫人物小傳形成的結(jié)果。我經(jīng)常用話劇舉例,它是一個很有特點的藝術(shù)坐標(biāo)。它沒有特效、沒有運鏡,全部靠表演,卻能讓觀眾坐在這裏將近4個小時。不論是國內(nèi)外,話劇演員的表演張力都非常強。什麼時候大模型能達到這樣的狀態(tài),就意味著AI視頻的敘事和內(nèi)容模式都進入到下一階段了。
我們現(xiàn)在看一個人錄視頻,哪怕他沒有名氣,隻要他說話有意思,我們都能盯著看很久。同樣的內(nèi)容,現(xiàn)在哪怕是Seedance 2.0生成的一個人,大家看超過3秒鍾就已經(jīng)覺得它不太對。在3到5秒都撐不住的情況下,很多藝術(shù)表達是不能實現(xiàn)的。可能也是這個原因,國外會更喜歡奇觀式的AI影像。我個人肯定更喜歡各種文戲,因為文戲才是故事的核心,但是目前的AI視頻就是有表演方麵的限製。
南方人物周刊:能不能理解為,AI與真人在表演精度上的差異,有一點像機器生產(chǎn)與手工藝品?
DiDi_OK:不完全是吧,因為目前AI視頻達不到工業(yè)生產(chǎn)的水平,也很難有觀眾買單。比如我非常喜歡山本耀司,我知道它隻有不到10%的產(chǎn)品堅持手工製作,其他的都是工業(yè)製品,但我還是會買,因為它的工業(yè)化程度已經(jīng)足夠高了。所以,我不會在意它是不是手工生產(chǎn)的,而隻在意它的設(shè)計語言。
按照AI此前的發(fā)展速度,我相信到年底,AI就能進入到每個人的生活。而且,到那個時候AI視頻絕對不會是主流資金的流動方向,畢竟AI視頻隻能看,不能吃也不能用,它所追求隻是無限接近於實拍效果。
大家再也不聊生成技術(shù)的時候,就是AI視頻絕對意義上跨過起點的時候。就像傳統(tǒng)拍攝中,真正聊攝像機的人其實是行業(yè)內(nèi)的人,行業(yè)外的人最多是拉一個片、聊一下,“這一次的這個鏡頭設(shè)計很棒。”這時候就會發(fā)現(xiàn),人們聊的是拍攝的技術(shù),而不再是硬件技術(shù)。我覺得到那一刻,AI視頻就完全跨過起點了。
相關(guān)文章