
2026/08/02 5:45
シードダンス 2.5
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
ByteDance が、長編ストーリーテリング、精密な編集、そして高度なマルチモーダル参照における画期的な進歩によりコンテンツ制作を革新することを目的とした次世代の動画生成モデル「Seedance 2.5」を正式にローンチしました。本モデルは、1 つのパスで高品質な 30 秒間のオーディオ・ビデオクリップを生成し、複数ラウンドの拡張をサポートして一貫性のある数分の長編ナラティブを作成できます。ユーザーはガイドとして最大 30 枚の画像、10 クリップ分の動画、または 10 クリップ分のオーディオを入力でき、テクスチャレスな 3D モデルを使用して複雑な空間構造を構築する際に役立つ粘土レンダリング参照も使用可能です。Seedance 2.5 はオーディオとビデオの精密な編集のためにタイムスタンプレベルの制御を導入し、グリーンスクリーンやカメラ視点変更などの機能を増強しつつ、カット間での対象物の安定性とビジュアル同期を保証します。システム最適化により、物体のテクスチャ、肌/目の特徴、物理法則に従う照明などといった視覚的な詳細が向上し、AI 動画に一般的な人工的な外見を大幅に軽減します。本技術は、歴史および科学的文脈向けの没入型教育シミュレーション、ロボットトレーニング用の合成データ生成、自動運転車両向けの極端な気象シナリオの安全なシミュレーションなど多様な用途への展開を可能にします。本日、Jimeng AI と Doubao Pro でお利用可能で、より広範な API アクセスは間もなく BytePlus ModelArk を介して提供されます。本モデルは、将来的な運動の妥当性と複雑なシーンにおける安定性の向上のための基盤を築きます。
本文
Seedance 2.5: 次世代ビデオ生成モデルの正式ローンチと主要機能紹介
本日、次世代のビデオ生成モデル**「Seedance 2.5」**を正式にローンチいたします。単なるクリップの生成から、より創造的な作品まで完成させることへと進化しているユーザーの期待に応えるため、基盤となる生成能力と参照に基づく生成能力を強化し、画期的な進歩を実現しました。
主な特長
-
単一パスで最大 30 秒の生成と複数ラウンドの拡張機能
- 一度の処理で高品質な30 秒間の音声・映像クリップを生成し、それを複数のラウンドにわたって拡張可能です。
- ショット間の遷移やシーン変更を改善し、連続性を持たせ、画像・音声・動きの品質を大幅に向上させました。
- これにより、一貫したオーディオビジュアル言語を持ちつつ数分に及ぶ高品質コンテンツを生産でき、物語を一挙に完成させることができます。
-
マルチモーダル参照機能の完全刷新
- 単一パスで最大以下の資料を入力可能です:
- 30 枚の画像
- 10 つのビデオクリップ
- 10 つの音声クリップ
- 粘土レンダリング、動き、創造的参照など多様な能力を強化し、制作者の意図を正確に捉えます。
- 複数の主題・シーンやショット変遷を含む複雑なアイデアを実現できます。
- 単一パスで最大以下の資料を入力可能です:
-
より精密かつ安定した編集機能
- 音声・映像コンテンツに対してタイムスタンプレベルでの制御を提供し、効率性とコントロール性を向上させます。
- グリーンスクリーン編集、カメラ視点の編集、参照に基づく編集などの高度な機能を強化しています。
- 映画や広告など、専門的で複雑な分野における厳格な要件にも対応可能です。
詳細機能と事例
1. 多ラウンド拡張による 30 秒の長編ストーリーテリング
Seedance 2.5 は、単一パスでの生成時間を15 秒から 30 秒へ延伸させました。これにより、複数の論理的に接続されたショットを編成し、「導入・展開・転換点・結」へと至る物語を展開できます。
- 物語の完全性: 単なる瞬間の延長ではなく、舞台裏から本番までの一貫した流れを描出します(例:歌手のパフォーマンス)。
- 拡張プロセス: 既存のビデオ出力に対して後続のショットを滑らかに追加でき、主要キャラクターや環境の一貫性を維持します。これにより、クリップ分割や接着の手間を削減できます。
- ビジュアル品質: カメラ運動間の遷移が滑らかになり、複数のカットを跨いでも被写体は安定しています。
T2V プロンプト例(テキストからビデオ生成)
「ワンテイクのハンディヘルドジンバル追尾ショット。カメラは厚い赤いカーテンの隙間からゆっくりと押し入り、暖色系のバックステージ dressing room に進入する。背を向けた若い女性歌手がイヤーピースを調整しているところ、スタッフが『そろそろ出る時間』と呼びかける。彼女はカメラに向かって向きを変え、シティポップを歌い始める。カメラは後退しながら彼女がカーテンを通り抜けて暗いバックステージの回廊へ進む様子を追跡し、道中でダンサーたちと自然に交流する様子を捉える。一人のスタッフがマイクを手渡す。その後、彼女とダンサーたちはステージへと歩き出し、カメラは円を描くように後ろを回りながら赤と黒のステージデザイン、LED スクリーン、スポットライト、スモーク、反射床盤を徐々に披露する。最後にカメラが引いてアミナ広角ショットとなり、満員の観客、ライトボード、グローンスティック、拍手する群衆が映され、コンサートの若々しく自由な精神に満ちたクライマックスが描かれる。」
R2V プロンプト例(参照画像からビデオ拡張)
「動画を拡張する。@Video 1 に示されたビジュアルと主題から続き、キャラクターの主題、シーン、ビジュアルスタイル、サウンドエフェクトを一貫させたまま、さらに 30 秒のクリップを生成する。少年がサッカーボールを持って電車車両内で走り、地下鉄が止まった際に側面ドアが開き、彼はすぐに外へ飛び出し、主人公らしき男性が彼を追いかけてくる。二人はプラットフォームを走り抜け、通りすがりの人々や車両を驚かせて街へと出た後、男がようやく追い catching し少年を掴む。少年は苦悩して見上げ、男の怒りは徐々に薄れ、彼は少年の頭を撫でながら helpless な笑顔を見せる。」
物理法則と照明制御
- 自然な動き: 袖の振りや髪の毛の状態など、物理法則に従った自然な動きを実現します。
- 系統適化: オブジェクトのテクスチャ、肌や目の特徴、照明、色調などを最適化し、人工的な外見を排除しました。
- 無制御なノイズ削減: 字幕やバックミュージックにおける不要な発生を最小限に抑え、シネマティック品質を提供します。
2. マルチモーダル参照機能への包括的アップグレード
複雑なクリエイティブタスクに対するより高いコントロールを実現しました。
- 多様な参照入力: ビジュアルコンポジション、シーン、スタイル、キャラクター、小道具などの要素を包括的に理解し、指示通りに適用します。
- マルチキャラクター対応: 複数のキャラクターの外見と声を保ちながら、各主題の特徴を一貫して維持します。
- 粘土レンダリング活用: テクスチャレスな 3D モデルを用いてシーンの空間構造や動きの経路を構築し、複雑なショット構成を再現できます。
- 照明制御: 光源の方向、色温度、強度、影の投影などを物理法則に従ってリアルに生成します。
R2V プロンプト例(オーケストラコンサート)
「16:9 横長でシネマティックリアリズムの持つ 30 秒のコンサートシーンを生成。会場は@Image 1 を参照し、ピアニストは@Image 2 を、チェリストは@Image 3 を、バイオリニストは@Image 4 を、リードボーカリストは厳密に@Image 5 に従うこと。オーケストラの残りは@Images 6〜10 を、コーラスは@Images 11〜14 を、観客席は@Images 15〜18 をそれぞれ参照する。リードボーカリストがステージ中央から最前列へ歩き出す。ピアニストはピアノのそばで鍵盤を叩き、リードボーカリストがスポットライトに現れて歌い始める。カメラはバイオリン、チェロ、オーケストラが演奏する様子を一貫して自然に移動し、バイオリンは明るく、チェロは温かみのある音色を表現する。後半ではコーラスも加わる。リードボーカリストは一瞬で最前列の観客と目を合わせ、観客からは微笑みと軽い頷きが返される。ラストショットではカメラが引いて全体的な会場を見渡し、歌が終わり観客が拍手に加わる。」
R2V プロンプト例(粘土レンダリングからの 3D アニメーション)
「@Clay Render 1 のカメラワーク、ペース、ショットサイズ遷移、主題の軌跡、ブロッキングを参照し、@Image 2 のキャラクターデザイン、シーン、材質、照明、色、ファンタジー雰囲気から、白系のモデルを夢のような温かい 3D アニメーションショートとしてレンダリングする。物語の流れは以下の通り:幻想的な空を通る飛行 → 雲海を飛ぶ神話の獣たちとの共演 → 海中へのダイブ → マントレイとともに深海をくぐり抜ける → 時空間の鏡面裂け目を通過 → 宇宙から星を拾う → ベッドルームに戻る → お父さんが毛布を敷いて寝かしつける → 絵本が閉じられて最終フレームに留まる。」
3. より精密で信頼性の高い編集
アイデアを忠実に実現し、生成コストや繰り返し作業の手間を削減します。
- タイムスタンプ制御: 特定時間範囲に対するナラティブ、カメラ視点、動き、リズムを制御可能です。
- ターゲッテッドな修正: 生成後のクリップ内でキャラクターやアクションに対して修正を施し、一貫性を保ちます。
- 高度な編集機能: グリーンスクリーン編集、カメラ視点編集、参照に基づく編集に対応し、背景の置換えや物理法則に沿った被写体反応(衣服の flutter など)を実現します。
R2V プロンプト例(グリーンスクリーン編集)
「@Video 1 を使用してグリーンスクリーンの背景、障害物、衣装、準主役をレンダリングする。
• 0–4 秒:屋外トレーニングで、障害物を岩、レンガ、タイヤ、木製パレットに置き換える。
• 4–10 秒:ロッカールームで仲間から応援を受ける。
• 10–15 秒:国際試合で、トレーニングポールを元のディフェンダーとゴールキーパーに置き換え、主人公がゴールを決める。全体を通してフォトリアリスティックでシネマティックな品質。」
R2V プロンプト例(カメラ運動の調整)
「@Video 1 を編集する。キャラクター、アクション、ビジュアルスタイルは変更しない。カメラ運動のみを調整する。15 秒に分割したカメラプラン:
• 0–4 秒:パンの横を微 FVP で緊密にスカーミングし、ポップされたトーストを追跡してウィップパンでコーヒーへ移動。
• 4–7 秒:パンの縁に沿って横向きにプッシュインしながら横向きに追跡し、フライドエッグが跳ね返って元の位置に戻る様子を追う。
• 7–11 秒:急上昇してトップダウンビューになり、その後一定のペースで下降し、プレートとキーを横断する。
• 11–15 秒:ハンディヘルドクロージョアップで手を追跡し、フェイストロピックウィップを使い、朝食にプッシュインした後ミディアムツースホットへ引き上げる。一連のシーケンス全体を滑らか・連続的かつ安定させてください。」
4. 業界シナリオへの浸透
実世界での価値を継続的に探索し、教育や製造などの分野で活用されています。
- 教育分野: 歴史的文脈や抽象的な内容をダイナミックなデモンストレーションに変換し、没入型の教材を提供します。
- 例: Doubao Learning アプリ「Doubao Classroom」にて、南宋時代の臨安の街景や辛弃疾の登場シーンを生成。
R2V プロンプト例(教育シナリオ)
「表現豊かな東洋画家風のスタイル。南宋時代の臨安の街景。幾つかの児童が活気ある通りを走り回り、「回ればそこにいた、灯りが暗くなる場所にある」と叫んでいる。カメラは走る児童を追跡し、活気ある通りを横断して通り過ぎる。その後カメラが上向きに傾き、@Image 1 の辛弃疾が現れる。辛弃疾が頭を向けると、遠くには消えていく提灯の光の中に一人の男が立っている。ショットは連続したままである。」
- 工業・自動運転分野: ロボットの訓練用データ生成や、極端な気象条件などのランゲイルシナリオシミュレーションに対応します。
- 例: 自動車組み立てシーンの粘土レンダリングからフォトリアリスティックな映像への変換。
R2V プロンプト例(自動車組み立て)
「@Clay Render 1 のカメラワーク、コンポジション、ショットスケール、空間関係、パーツの位置、モデル構造、組み立て順序、動きの経路を参照し、@Image 1 の材質、照明、色、反射、雰囲気から粘土レンダリングを高品質なフォトリアリスティックな自動車組み立てシーケンスへ変換する。」
アクセス方法
Seedance 2.5は本日より一般利用を開始します。
- Jimeng AI
- Doubao Pro
- 間もなく BytePlus ModelArk(API アクセス)でも利用可能になります。
アクセス手順
- Jimeng Web → 「Video Generation」→ Seedance 2.5 を選択
- Doubao Pro → 「Video Generation」→ Seedance 2.5 を選択
プロジェクトホームページ
是非お試しください。ご意見・ご感想をお待ちしております。