
2026/09/05 4:48
AI は既に回路基板の設計ができるでしょうか?
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
OpenAI は最近、KiCad で回路基板を設計する GPT-6 Astra の実演を行いましたが、これは AI が生成した電子機器の品質をどのように評価するかという議論を巻き起こしました。これを踏まえ、atople を用いた宣言的なコードベースの回路設計により、グラフィック CAD ツールの代わりにエージェントがコンポーネントや制約に直接働きかけ、UI の状態管理を行わずに設計できる EEBench フレームワークが導入されました。このベンチマークは、5V 停電中にコンデンサがプロセッサへの電源供給を維持する必要がある住宅用エネルギーメータータスクなど、現実世界の複雑性をモデルに対して試験します。また、部品の許容差(例:X5R の温度係数)を考慮し、最悪のシナリオをシミュレートして電圧制限、回復時間、パッケージ定格をチェックします。高度なタスクには、オペアンプを中心として多重フィードバックローパスフィルタを合成しつつ、抵抗値・容量比を許容限界内で決定することなどがあります。EEBench は、実際のメーカー製部品とデータシート仕様の情報を SPICE モデルに埋め込み、電気的性能、コスト、供給可能性の間のトレードオフを強要します。評価は完全に決定論的です:ハネスが回路を構築し、部品台帳を作成し、SPICE シミュレーションを実行し、測定電圧を制限値と比較して技術スコアを生成します。初期の V1 結果(9 月)では、13 タスクにおいて Claude Opus 5 が 61.6%のスコアで首位に立ち、Grook 4.6 が 57.1%、Claude Fable 5.1 が 56.4%、GPT-5.5 が 42.3%、GPT-5.6 Sol が 39.4%という成績でした。GPT-6 Astra の結果については、厳格な評価基準のため非公開となっています。シミュレーション実行に失敗したケースは、電圧制限を逸脱するなど具体的なフィードバックを提供し、強化学習後のポストトレーニングにおける報酬信号として活用できます。一部の回路設計は実現可能ですが、専門家は製造業者が電気的性能と部品供給の可能性を安全にバランスさせることができない限り、AI によって設計されたペースメーカーなどの重要なハードウェアを盲目的に設置することをお勧めしません。産業全体は、理論的なグラフから実際のデータシート仕様へ移行する必要があるでしょう。xAI はまた、高品質なエンジニアリングデータのトレーニングを活用して 60.0%という公開スコアを達成し、「エンジニアリングの加速」という項目において EEBench を Grok 4.6 のモデルカードに含めました。
- フォーマットチェック:
- 欠けている要素が明確に記載されています。
- 推論・飛躍は特定され、説明されています。
- リストからすべての主要ポイントを統合しつつ明瞭さを保つ改善されたサマリーが提供されました。
本文
OpenAI が公開した GPT-6「Astra」:電子工学設計における AI の可能性と限界
OpenAI により KiCad を用いた回路基板設計を行える GPT-6「Astra」のプロトタイプが公開されました。これにより、AI が電子工学の分野に正式に参入したことが明らかになりました。しかし、現在では単一のプロンプトで携帯電話全体を組み立てる段階には達しておらず、「AI が生成する回路の性能をどのように評価すべきか?」という重要な問いが生じています。
1. モデルが持つ意外な電子工学知識
既存の設計ツールや GUI ベースのアプローチと比べ、現在の LLM(大規模言語モデル)は教科書、データシート、コードを読み込むことで深い電子工学知識を有しています。
デモグラフィックな CAD ツール vs 宣言形式コード
- GUI 操作の限界
- エージェントが画面を追跡するため、多くの時間をクリック操作に費やす。
- コンテキストの大部分が座標情報やメニュー状態など、電子工学とは無関係なものになる。
- EEBench のアプローチ(atopile 手法)
- 回路を宣言形式のコードとして定義する。
- エージェントはコンポーネント、接続、電気的制約に直接働きかける。
- デザインの変更、構築、シミュレーション、故障検査までプロジェクト内で完結させる。
- GUI 上で線を描かせることよりも圧倒的に効果的。
起動設計の例(atopile v2):
.ELEC: @STD::Import { .project &= "electronics" .org &= "atopile" } .Submission: @type { .vin: ELEC::ElectricPower .vhold: ELEC::ElectricPower .vhold.lv ~ .vin.lv .c_bank: ELEC::Capacitor { .capacitance &= 22uF +/- 20% .max_voltage &= 10V..25V .temperature_coefficient &= "X5R" .package &= "0805" } .vhold.hv ~> .c_bank ~> .vhold.lv }
2. 現実世界は複雑です:エネルギー計タスクの課題
公開されたタスクの一つである「住宅用エネルギー計」を想定したシナリオでは、5V 供給電源が途絶えた際にも以下を実現する必要があります。
- 必須要件: プロセッサを 20ms 間稼働させ続け、読み込みデータを保存する。
- 保護条件: その間、プロセッサの電圧(3.0V)を上回る保護レール電圧を維持する。
モデルの誤解と現実のハードル
多くのモデルは直感的に「コンデンサを追加する」と回答しますが、実際の部品特性では課題が生じます。
- セラミックコンデンサの特性: 電圧がかかるとカタログ値より容量が著しく低下する。
- 許容誤差: 部品には固有のばらつきが存在する。
- トレードオフ:
- 容量増大はコスト増とスペース消費を招く。
- レール再充電速度が遅くなる。
- 公称値(Nominal)での動作設計は、実際の許容誤差下では失敗する可能性が高い。
EEBench の検証プロセス
シミュレーションにおいて以下の項目を測定します。
- 停電中の電圧維持時間。
- 動作点での実効容量。
- 電力復帰後の回復挙動。
- パッケージ、誘電体、電圧定格、コストに対する制約。
失敗した例(ngspice 出力) 保護されたレールは初期に約 4.55V で始まり、必要な 20ms の前に 0.85ms という早い時点で 3V レベルを割り込んでいます。
- 結論: 要件を満たさず失敗判定となりました。
より困難なアナログタスク
- オペアンプを用いた多段フィードバックローパスフィルタの設計。
- 必要な極(Pole)を実現するための抵抗器・コンデンサ比の計算。
- 許容誤差の端境域(限界付近)においても、ゲイン・カットオフ周波数・Q 係数を制限内に保つ必要がある。
- テストハネスが SPICE デッキを自動生成し、AC および過渡解析を実行して仕様沿いの結果を検証する。
エンジニアリングの真価:トレードオフ
方程式を導出するだけでは不十分です。EEBench では以下の点を求めます。
- メーカー製部品の実データシートを SPICE モデルに組み込む。
- 許容誤差全体で機能する組み合わせを見つける。
- 存在し、発注可能かつ適正価格帯の部品を選択する。
- これは教科書の理想値を選ぶことより、「実際のハードウェア設計に近い行為」。
3. 採点方法について
EEBench のチェックは完全に決定論的です。
- 設計の構築: 提出された設計を構築し、回路グラフおよび部品リスト(BOM)を作成。
- シミュレーション実行: SPICE シミュレーションと設計チェックを一連で実施。
- 要件測定: 各要件に対し、測定値とその上限値を設定して判定。
評価項目の具体例
- エネルギー計タスク: 電源切替時(落ち・復帰)における保護レールの挙動。
- その他タスク: ゲイン、しきい値、リップル、過渡応答、コンポーネント許容誤差下の挙動。
- 技術スコア: コスト効率も組み込まれるが、回路が実際に動作する場合のみ有効。
これはコーディングエージェントの評価に近いですが、テスト対象が「電圧や部品挙動」を直接測定する点が異なります。現在(V1)はアナログおよびデジタル設計の両方をカバーしており、完全な製造・起動(ブリングアップ)機能は今後追加予定です。
4. リーダーボードの結果(9 月度)
現在のスコア状況です。
| ランク | モデル名 | スコア |
|---|---|---|
| 1 | Claude Opus 5 | 61.6% |
| 2 | Grok 4.6 | 57.1% |
| 3 | Claude Fable 5.1 | 56.4% |
| 4 | Claude Fable 5 | 54.3% |
| 5 | Claude Opus 4.8 Max | 51.4% |
- OpenAI のモデル: リスト下部に位置(GPT-5.5: 42.3%, GPT-5.6 Sol: 39.4%)。
- 注: GPT-6「Astra」の結果はまだ公開されていません。
- xAI の動き: Grok 4.6 を「エンジニアリング加速」項目で EEBench と並列評価しています(xhigh モード: 60.0%)。
5. トレーニング環境への応用
シミュレーションハネスを用いて回路を採点できるようになることで、電子工学用の強化学習環境の萌芽が生まれています。
- 報酬信号としての活用: 同じチェック項目をポストトレーニングの報酬信号に使用可能。
- 失敗分析からの学習:
- どの電圧が上限を超えたか。
- どの動作領域(オペレーティングカーン)で失敗したか。
- コストが高すぎる設計になっているか。
- これにより、単に「回路図は妥当に見える」と言うモデルに対し、より詳細なフィードバックを提供できる。
現在では frontier lab と直接連携を開始しており、評価(evals)やポストトレーニングに取り組む企業・ラボに対して、大規模評価スイートやシミュレーション backed のトレーニング環境を提案可能です。
6. 最後に:回路基板を設計できるのか?
有用な回路問題に対する答えは**「はい」**です。スコアにはまだ多くの改善余地がありますが、以下の兆候は明白です。
- OpenAI が「Astra」のデモとして PCB デザインを選択。
- xAI がモデルカードに EEBench を掲載し、「エンジニアリング加速」として認知。
- AI ラボが電子工学を真剣に取り組んでいる証拠。
今後の展望
- Elon Musk 氏が SpaceX のデータを追加トレーニングした後、Grok 4.7(エンジニアリング能力強化版)を数週間で投入予定との噂。
- より困難なタスクへの拡張と、Astra や次世代モデルのパフォーマンス監視が必要。
結論
AI は回路基板の設計は可能ですが、ペースメーカーのような生命に関わる機器を設計し、盲目にインストールする段階ではありません。しかし、そこへ向かう途中にあります。
EEBench は atopile のチームによって構築・資金提供されており、公衆向けのベンチマーク実行コストを負担しています。スコア販売は行っていません。